Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Каковы некоторые распределения по вероятностному симплексу?
Пусть - вероятностный симплекс размерности K - 1 , т. Е. X ∈ Δ K таково, что x i ≥ 0 и ∑ i x i = 1 .ΔKΔK\Delta_{K}K−1K−1K-1x∈ΔKx∈ΔKx \in \Delta_{K}xi≥0xi≥0x_i \ge 0∑ixi=1∑ixi=1\sum_i x_i = 1 Какие дистрибутивы , которые часто (или хорошо известны, или определенные в прошлом) над существует?ΔKΔK\Delta_{K} …

3
Поиск в сетке по к-кратной перекрестной проверке
У меня есть набор данных из 120 образцов в 10-кратной перекрестной проверке. В настоящее время я выбираю обучающие данные первого удержания и делаю 5-кратную перекрестную проверку для этого, чтобы выбрать значения гаммы и C с помощью поиска по сетке. Я использую SVM с ядром RBF. Так как я делаю перекрестную …

2
Страдает ли классификация GBM несбалансированными размерами классов?
Я имею дело с контролируемой проблемой бинарной классификации. Я хотел бы использовать пакет GBM для классификации людей как незараженных / зараженных. У меня в 15 раз больше незараженных, чем у инфицированных. Мне было интересно, страдают ли модели GBM в случае несбалансированных размеров классов? Я не нашел никаких ссылок на этот …

2
Меры остаточной гетероскедастичности
Эта ссылка на Википедию перечисляет ряд методов для определения гетероскедастичности остатков МНК. Я хотел бы узнать, какой практический метод более эффективен в обнаружении областей, затронутых гетероскедастичностью. Например, здесь видно, что центральная область на графике OLS «Остаточные и адаптированные» имеет более высокую дисперсию, чем стороны графика (я не совсем уверена в …

2
Что такое R-структура G-структура в глмм?
Я недавно использовал MCMCglmmпакет. Меня смущает то, что в документации упоминается как R-структура и G-структура. Похоже, что они связаны со случайными эффектами - в частности, указанием параметров для предварительного распределения по ним, но обсуждение в документации, похоже, предполагает, что читатель знает, что это за термины. Например: необязательный список предыдущих спецификаций, …

1
Гауссовский процесс: свойства аппроксимации функции
Я изучаю гауссовский процесс и слышал только кусочки. Буду очень признателен за комментарии и ответы. Верно ли, что для любого набора данных приближение функции гауссовского процесса даст нулевую или незначительную ошибку подгонки в точках данных? В другом месте я также слышал, что гауссовский процесс особенно хорош для шумных данных. Похоже, …

3
Auto.arima vs autobox они отличаются?
Из чтения сообщений на этом сайте я знаю, что есть функция R auto.arima(в forecast пакете ). Я также знаю, что IrishStat , участник этого сайта, создал коммерческий пакет autobox в начале 1980-х годов. Поскольку эти два пакета существуют сегодня и автоматически выбирают модели arima для заданных наборов данных, что они …

3
Коллинеарные переменные в обучении LDA Multiclass
Я тренирую многоклассный классификатор LDA с 8 классами данных. Во время обучения я получаю предупреждение: « Переменные коллинеарны » Я получаю точность обучения более 90% . Я использую библиотеку scikits-learn в Python, обучаю и проверяю данные мультикласса . Я также получаю приличную точность тестирования (около 85% -95% ). Я не …

3
MLE требует данных iid? Или просто независимые параметры?
Оценка параметров с использованием оценки максимального правдоподобия (MLE) включает в себя оценку функции правдоподобия, которая отображает вероятность появления выборки (X) в значения (x) в пространстве параметров (θ) при заданном семействе распределения (P (X = x | θ). ) по возможным значениям θ (примечание: я прав в этом?). Все примеры, которые …

2
Как запустить двухстороннюю ANOVA на данных без нормальности и равенства дисперсии в R?
Сейчас я работаю над магистерской диссертацией и планирую запустить статистику с SigmaPlot. Однако, проведя некоторое время со своими данными, я пришел к выводу, что SigmaPlot может не подходить для моей проблемы (я могу ошибаться), поэтому я начал свои первые попытки в R, что не совсем облегчило задачу. План состоял в …

4
Очистка данных несовместимого формата в R?
Я часто имею дело с грязными данными опросов, которые требуют большой очистки, прежде чем можно будет сделать какую-либо статистику. Я делал это вручную в Excel, иногда используя формулы Excel, а иногда проверял записи по одному. Я начал выполнять все больше и больше этих задач, написав сценарии для их выполнения на …
16 r  data-cleaning 

2
Вычисление стандартной ошибки в средневзвешенной оценке
Предположим , что w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_n и каждый обращается н.о.р. из некоторых распределений с независимо от . В строго положительны. Вы наблюдаете все , но не ; скорее вы наблюдаете . Я заинтересован в оценке из этой информации. Очевидно, что оценщик является беспристрастным и может быть вычислен с учетом имеющейся информации.x1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_nwiwiw_ixixix_iwiwiw_iwiwiw_ixixix_i∑ixiwi∑ixiwi\sum_i x_i …

1
Интерпретация результатов теста причинности Грейнджер
Я пытаюсь научить себя Грейнджер Причинности. Я прочитал сообщения на этом сайте и несколько хороших статей в Интернете. Я также наткнулся на очень полезный инструмент, Bivariate Granger Causality - бесплатный статистический калькулятор , который позволяет вам вводить временные ряды и вычислять статистику Грейнджера. Ниже приведен пример данных, представленных на сайте. …

3
Вычисление нового стандартного отклонения с использованием старого стандартного отклонения после изменения набора данных
У меня есть массив из nnn реальных значений, который имеет среднее значение μoldμold\mu_{old} и стандартное отклонение σoldσold\sigma_{old} . Если элемент массива xixix_i заменяется другим элементом , то новое среднее значение будетxjxjx_j μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} Преимущество этого подхода в том, что он требует постоянного вычисления независимо от значения . Есть ли какой-либо подход …

3
Нахождение MLE для одномерного экспоненциального процесса Хоукса
Одномерный экспоненциальный процесс Хоукса - это саморегулирующийся точечный процесс со скоростью поступления событий: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} где - время прибытия события.t1,..tnt1,..tn t_1,..t_n Функция логарифмического правдоподобия −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} который можно вычислить рекурсивно: −tnμ+αβ∑(e−β(tn−ti)−1)+∑ln(μ+αR(i))−tnμ+αβ∑(e−β(tn−ti)−1)+∑ln⁡(μ+αR(i)) - t_n \mu + …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.