Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как найти доверительный интервал для общего количества событий
У меня есть детектор, который обнаружит событие с некоторой вероятностью р . Если детектор сообщает, что событие произошло, то это всегда так, поэтому ложных срабатываний нет. Через некоторое время я получаю k обнаруженных событий. Я хотел бы подсчитать, каково было общее количество событий, которые произошли, обнаружены или нет, с некоторой …

5
Является ли переменная значимой в модели линейной регрессии?
У меня есть модель линейной регрессии с выборочными и переменными наблюдениями, и я хочу знать: Является ли конкретная переменная достаточно значимой, чтобы оставаться включенной в модель. Должна ли другая переменная (с наблюдениями) быть включена в модель. Какая статистика может мне помочь? Как получить их наиболее эффективно?

4
Расчет соотношения выборочных данных, используемых для подбора модели / обучения и проверки
Предоставил размер выборки «N», который я планирую использовать для прогнозирования данных. Каковы некоторые из способов подразделить данные так, чтобы я использовал некоторые из них для установления модели, а остальные данные для проверки модели? Я знаю, что нет черно-белого ответа на этот вопрос, но было бы интересно узнать некоторые «практические правила» …

2
Визуализация нескольких «гистограмм» (гистограмм)
У меня возникают трудности с выбором правильного способа визуализации данных. Допустим, у нас есть книжные магазины , в которых продаются книги , и у каждой книги есть хотя бы одна категория . Для книжного магазина, если мы посчитаем все категории книг, мы получим гистограмму, которая показывает количество книг, которые попадают …

1
Как я могу использовать оптимальное масштабирование для масштабирования порядковой категориальной переменной?
В ответе на этот вопрос о трактовке категориальных данных как непрерывного оптимального масштабирования было упомянуто. Как работает этот метод и как он применяется?

2
Как определить, подходит ли модель выживания с отсутствующими данными?
Проще говоря, у меня есть около миллиона записей, которые записывают время входа и выхода людей в системе, охватывающей около десяти лет. У каждой записи есть время входа, но не у каждой записи есть время выхода. Среднее время в системе составляет ~ 1 год. Отсутствующие времена выхода происходят по двум причинам: …


7
Нормальное распределение и монотонные преобразования
Я слышал, что многие количества, которые встречаются в природе, обычно распределяются. Обычно это оправдано с использованием центральной предельной теоремы, которая гласит, что при усреднении большого числа случайных величин iid вы получаете нормальное распределение. Так, например, признак, который определяется аддитивным эффектом большого числа генов, может быть приблизительно нормально распределен, поскольку значения …

2
Влияет ли реализация перекрестной проверки на ее результаты?
Как вы знаете, существует два популярных типа перекрестной проверки: K-кратная и случайная субсэмплинг (как описано в Википедии ). Тем не менее, я знаю, что некоторые исследователи делают и публикуют статьи, где нечто, описываемое как K-кратное резюме, действительно является случайным субсэмплингом, поэтому на практике вы никогда не узнаете, что на самом …




3
Если
Это не домашнее задание. Пусть - случайная величина. Если и , следует ли из этого, что ?ИксXXE [X] = k ∈ RE[X]=k∈R\mathbb{E}[X] = k \in \mathbb{R}Вар [ Х] = 0Var[X]=0\text{Var}[X] = 0Pr ( X= к ) = 1Pr(X=k)=1\Pr\left(X = k\right) = 1 Интуитивно это кажется очевидным, но я не уверен, …

3
Непонимание оценки Монте-Карло Пи
Я вполне уверен, что понимаю, как работает интеграция Монте-Карло, но я не понимаю формулировку того, как она используется для оценки числа Пи. Я иду по процедуре, описанной в 5-м слайде этой презентации http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf Я понимаю предварительные шаги. Пи в 4 раза больше площади четверти единицы круга. А площадь верхней правой …

1
Разница между наивными байесовскими и рекуррентными нейронными сетями (LSTM)
Я хочу провести анализ настроений над текстом, прочитал несколько статей, некоторые из них используют «Наивный байесовский», а другие - «Рекуррентную нейронную сеть (LSTM)» , с другой стороны, я видел библиотеку python для анализа настроений, которая это нлтк. Он использует "Наивный байесовский", может кто-нибудь объяснить, в чем разница между этими двумя? …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.