Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Захват сезонности в множественной регрессии для ежедневных данных
У меня есть ежедневные данные о продажах для продукта, который является очень сезонным. Я хочу уловить сезонность в регрессионной модели. Я читал, что если у вас есть квартальные или месячные данные, в этом случае вы можете создать 3 и 11 фиктивных переменных соответственно - но могу ли я иметь дело …

2
Расчет
Я читал о расчете значений в смешанных моделях и после прочтения FAQ по R-sig, других постов на этом форуме (я бы связал несколько, но мне не хватает репутации) и нескольких других ссылок, которые я понимаю, используя Значения в контексте смешанных моделей сложны.R 2р2R2R^2р2R2R^2 Однако недавно я наткнулся на эти две …

1
Интеграция эмпирического CDF
У меня есть эмпирическое распределение . Я рассчитываю это следующим образомG(x)G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) Я обозначаю , т. - это pdf, а - это cdf.h Gh(x)=dG/dxh(x)=dG/dxh(x) = dG/dxhhhGGG Теперь я хочу решить уравнение для верхнего предела интегрирования (скажем, ), чтобы ожидаемое значение …
13 r  integral  ecdf 


1
Понимание критерия хи-квадрат и распределения хи-квадрат
Я пытаюсь понять логику теста хи-квадрат. Критерий хи-квадрат равен . Затем сравнивается с распределением хи-квадрат, чтобы определить значение p., чтобы отклонить или не принять нулевую гипотезу. : наблюдения получены из распределения, которое мы использовали для создания наших ожидаемых значений. Например, мы могли бы проверить, дается ли вероятность получения как мы …

2
Онлайн оценка квартилей без сохранения наблюдений
Мне нужно вычислить квартили (Q1, медиана и Q3) в режиме реального времени на большом наборе данных без сохранения наблюдений. Сначала я попробовал алгоритм P-квадрата (Jain / Chlamtac), но меня это не удовлетворило (слишком частое использование процессора, и я не был уверен в точности, по крайней мере, в моем наборе данных). …

1
Как интерпретировать автокорреляцию
Я рассчитал автокорреляцию по данным временного ряда о характере движения рыбы по ее положениям: X ( x.ts) и Y ( y.ts). Используя R, я запустил следующие функции и создал следующие графики: acf(x.ts,100) acf(y.ts,100) Мой вопрос, как мне интерпретировать эти сюжеты? Какая информация необходима, чтобы сообщить о каком-либо шаблоне? Я занимался …

4
Модель регрессии, чья переменная ответа - день года, когда происходит ежегодное событие (обычно)
В данном конкретном случае я имею в виду день замерзания озера. Эта дата «обледенения» встречается только один раз в год, но иногда вообще не происходит (если зима теплая). Таким образом, в один год озеро может замерзнуть в день 20 (20 января), а в другой год оно может вообще не замерзнуть. …

2
Вы наблюдаете k голов из n бросков. Честная ли монета?
Мне задали этот вопрос с в интервью. Есть ли «правильный» ответ?(n,k)=(400,220)(n,k)=(400,220)(n, k) = (400, 220) Предположим, что броски одинаковы, а вероятность голов составляет p=0.5p=0.5p=0.5 . Распределение числа голов в 400 бросках должно быть близко к нормальному (200, 10 ^ 2), так что 220 голов - это 2 стандартных отклонения от …

4
Что вы делаете, когда нет точки локтя для кластеризации kmeans?
Я узнал, что при выборе количества кластеров, вы должны искать точку сгиба для разных значений K. Я построил значения Inss для значений k от 1 до 10, но я не вижу четкого локоть. Что вы делаете в таком случае?

2
Использование BIC для оценки количества k в KMEANS
В настоящее время я пытаюсь вычислить BIC для моего игрушечного набора данных (ofc iris (:). Я хочу воспроизвести результаты, как показано здесь (Рис. 5). Этот документ также является моим источником для формул BIC. У меня есть 2 проблемы с этим: Обозначения: ninin_i я = количество элементов в кластереiii CiCiC_i я …

1
В поисках теоретического понимания логистической регрессии Ферт
Я пытаюсь понять логистическую регрессию Фёрта (метод обработки идеального / полного или квази-полного разделения в логистической регрессии), чтобы я мог объяснить это другим в упрощенном виде. У кого-нибудь есть придуманное объяснение того, что модифицирует оценка Фёрта для MLE? Я прочитал, как мог, Ферт (1993), и я понимаю, что к функции …

1
Использование взаимной информации для оценки корреляции между непрерывной переменной и категориальной переменной
Что касается названия, идея состоит в том, чтобы использовать взаимную информацию, здесь и после MI, для оценки «корреляции» (определяемой как «насколько я знаю об A, когда я знаю B») между непрерывной переменной и категориальной переменной. Я расскажу вам свои мысли по этому вопросу через минуту, но прежде чем посоветовать вам …

1
Объясните шаги алгоритма LLE (локальное линейное вложение)?
Я понимаю, что основной принцип, лежащий в основе алгоритма LLE, состоит из трех этапов. Нахождение окрестности каждой точки данных по некоторой метрике, такой как k-nn. Найти веса для каждого соседа, которые обозначают влияние, которое сосед оказывает на точку данных. Построить низкоразмерное вложение данных на основе вычисленных весов. Но математическое объяснение …

3
Форматирование графиков: когда уместно использовать заливку под линейным графиком?
Это вопрос визуализации данных - надеюсь, здесь можно задать этот вопрос. Когда целесообразно использовать заливку под линейным графиком для временного ряда, как на графике ниже? (который показывает время пинга за день) Я предполагаю, что более распространенным является использование простой линии без заливки внизу, но нормально ли использовать заливку для визуального …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.