Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
SD больше среднего, неотрицательная шкала
Мне дали статью, в которой сообщалось об исследовании, очень похожем на исследование, которое хочет провести моя лаборатория. Но я заметил, что для интересующей переменной, Duration, SD больше среднего ... так как эта длительность измеряется в минутах, она никогда не может быть отрицательной, и это кажется мне очень странным. Это произошло …

1
Пример CLT, когда моменты не существуют
РассмотримXn=⎧⎩⎨1−12kw.p. (1−2−n)/2w.p. (1−2−n)/2w.p. 2−k for k>nXn={1w.p. (1−2−n)/2−1w.p. (1−2−n)/22kw.p. 2−k for k>nX_n = \begin{cases} 1 & \text{w.p. } (1 - 2^{-n})/2\\ -1 & \text{w.p. } (1 - 2^{-n})/2\\ 2^k & \text{w.p. } 2^{-k} \text{ for } k > n\\ \end{cases} Мне нужно показать, что, хотя это имеет бесконечные моменты,n−−√(X¯n)→dN(0,1)n(X¯n)→dN(0,1)\sqrt{n}(\bar{X}_n) \overset{d}{\to} N(0,1) …

1
Эквивалентность AIC и p-значений при выборе модели
В комментарии к ответу на этот вопрос было указано, что использование AIC при выборе модели эквивалентно использованию значения p 0,154. Я попробовал это в R, где я использовал «обратный» алгоритм выбора подмножества, чтобы выбросить переменные из полной спецификации. Во-первых, путем последовательного выброса переменной с самым высоким значением p и остановки, …


2
Как бы вы визуализировали сегментированную воронку? (а вы могли бы сделать это с Python?)
Я видел этот пост на Moz, который представил сегментированную маркетинговую воронку: Такие вещи будут иметь большую ценность в моей работе. Я понятия не имею, как визуализировать необработанные данные, чтобы показать сегментированную воронку, подобную этой. Идея состоит в том, что коммерческие предложения поступают из разных источников (которые мы используем для сегментирования …


1
Предельное значение расстояния Кука
Я читал на расстоянии повара, чтобы определить выбросы, которые имеют большое влияние на мою регрессию. В оригинальном исследовании Кука он говорит, что уровень отсечки 1 должен быть сопоставим для выявления влияющих факторов. Тем не менее, различные другие исследования используют или в качестве отсечения.4N4N\frac{4}{n}4n - k - 14N-К-1\frac{4}{n-k-1} В моем исследовании …

2
Конвергенция в распределении \ CLT
Учитывая, что , условный дистр. из есть . имеет маргинальный дистр. Пуассона ( ), - положительная постоянная.Y χ 2 ( 2 n ) N θ θN= пNзнак равноNN = nYYYχ2( 2 н )χ2(2N)\chi ^2(2n)NNNθθ\thetaθθ\theta Покажите, что как , в распределении.( Y - E ( Y ) ) / √θ → …

2
Смещение оптимизма - оценки ошибки прогноза
В книге «Элементы статистического обучения» (доступно в формате PDF онлайн) обсуждается предвзятость (7.21, стр. 229). В нем говорится, что смещение оптимизма - это разница между ошибкой обучения и ошибкой в ​​выборке (ошибка наблюдается, если мы выбираем новые значения результатов в каждой из исходных точек обучения) (см. Ниже). Далее он заявляет, …

2
R обнаружить увеличение / уменьшение тренда временных рядов
У меня много временных рядов с периодами: день, неделя или месяц. С помощью stl()функции или с помощью loess(x ~ y)я могу видеть, как выглядят тренды определенного временного ряда. Мне нужно определить, увеличивается или уменьшается тренд временного ряда. Как я могу справиться с этим? Я попытался вычислить коэффициенты линейной регрессии lm(x …
9 r  time-series  trend 

1
Установка изменяющегося во времени коэффициента DLM
Я хочу приспособить DLM с изменяющимися во времени коэффициентами, то есть расширением к обычной линейной регрессии, .YT= θ1+ θ2Икс2YTзнак равноθ1+θ2Икс2y_t = \theta_1 + \theta_2x_2 У меня есть предиктор ( ) и переменная отклика ( y t ), ежегодный морской и внутренний вылов рыбы соответственно с 1950 - 2011 гг. Я …

2
Почему 0,05 <p <0,95 результатов называют ложноположительными?
Редактировать: основа моего вопроса ошибочна, и мне нужно потратить некоторое время на выяснение того, можно ли вообще сделать это, чтобы иметь смысл. Редактировать 2: Уточняя, что я признаю, что значение p не является прямой мерой вероятности нулевой гипотезы, но я предполагаю, что чем ближе значение p к 1, тем больше …

1
Должен ли я сообщать достоверные интервалы вместо доверительных интервалов?
Наткнувшись на концепцию в учебнике по статистике, я попытался обдумать это и, наконец, пришел к выводу, который, по-видимому, соответствует всем объяснениям, которые я видел до сих пор: достоверный интервал - это то, что, по мнению статистиков, является достоверным интервал есть. Отступление для таких, как я из часа назад, которые не …

3
Интуиция о совместной энтропии
У меня проблемы с построением некоторой интуиции о совместной энтропии. = неопределенность в совместном распределении ; = неопределенность в ; = неопределенность в .p ( x , y ) H ( X ) p x ( x ) H ( Y ) p y ( y )ЧАС( Х, Y)ЧАС(Икс,Y)H(X,Y)р ( …

1
Как оценка максимального правдоподобия имеет приблизительное нормальное распределение?
Я читал о MLE как о методе создания подобранного распределения. Я натолкнулся на утверждение о том, что оценки максимального правдоподобия «имеют приблизительное нормальное распределение». Означает ли это, что если я буду применять MLE несколько раз к своим данным и семейству дистрибутивов, к которым я пытаюсь соответствовать, модели, которые я получу, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.