Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Каковы различия между регрессией Риджа с использованием R glmnet и Python scikit-learn?
Я изучаю раздел LAB §6.6, посвященный регрессии Риджа / Лассо, в книге Джеймса Виттена «Hastie», Tibshirani (2013) «Введение в статистическое обучение с приложениями в R» . Более конкретно, я пытаюсь применить модель scikit-learn Ridgeк набору данных 'Hitters' из пакета R 'ISLR'. Я создал такой же набор функций, как показано в …

1
Общее р-значение и попарные р-значения?
Я установил общую линейную модель логарифмическая вероятность которой .L uy=β0+β1x1+β2x2+β3x3,y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,LuLuL_u Теперь я хочу проверить, совпадают ли коэффициенты. Во-первых, общий тест: логарифмическая вероятность уменьшенной модели равна . По критерию отношения правдоподобия полная модель значительно лучше, чем уменьшенная с .L r p = 0,02y=β0+β1⋅(x1+x2+x3)y=β0+β1⋅(x1+x2+x3)y=\beta_0+\beta_1\cdot(x_1+x_2+x_3)LrLrL_rp=0.02p=0.02p=0.02 Далее ? Сокращенная модель - это . В …

2
Смещенная начальная загрузка: можно ли центрировать КИ вокруг наблюдаемой статистики?
Это похоже на Bootstrap: оценка находится вне доверительного интервала У меня есть некоторые данные, которые представляют количество генотипов в популяции. Я хочу оценить генетическое разнообразие, используя индекс Шеннона, а также создать доверительный интервал с помощью начальной загрузки. Я заметил, однако, что оценка с помощью начальной загрузки имеет тенденцию быть чрезвычайно …

2
Почему так редко сообщают доверительные интервалы для медиан?
Почему так редко можно найти доверительные интервалы, о которых сообщается в статьях из прикладных наук? Я работаю в основном в области компьютерных наук, но часто читаю статьи по (социальной) психологии, социологии и городскому планированию. Я не могу вспомнить, видел ли CI для медианы, о которой сообщалось. В то же время, …

2
Почему Ограниченная максимальная вероятность дает лучшую (непредвзятую) оценку дисперсии?
Я читаю теоретическую статью Дуга Бейтса о пакете lme4 в R, чтобы лучше понять суть смешанных моделей, и натолкнулся на интригующий результат, который я хотел бы лучше понять, об использовании ограниченного максимального правдоподобия (REML) для оценки дисперсии , В разделе 3.3, посвященном критерию REML, он утверждает, что использование REML при …

1
Для какого типа выбора можно использовать критерий хи-квадрат?
Здесь я спрашиваю о том, что обычно делают другие, чтобы использовать критерий хи-квадрат для выбора функции по результатам в контролируемом обучении. Если я правильно понимаю, проверяют ли они независимость между каждой функцией и результатом и сравнивают значения p между тестами для каждой функции? В http://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test , Критерий хи-квадрат Пирсона - …

1
Как интерпретировать остаточные цвета на мозаичном графике?
Это мозаичный график набора данных таблицы сопряженности, HairEyeColorописанный здесь . Как мне интерпретировать цвета, представляющие остатки? В чем разница между высокими и положительными остатками Пирсона (показаны синим цветом) по сравнению с низкими и отрицательными, показанными красным цветом?

2
Оптимальное биннинг по отношению к заданной переменной отклика
Я ищу оптимальный метод биннинга (дискретизации) непрерывной переменной по отношению к заданной ответной (целевой) двоичной переменной и с максимальным количеством интервалов в качестве параметра. пример: у меня есть набор наблюдений за людьми с переменными "высота" (цифра непрерывная) и "has_back_pains" (бинарная). Я хочу разделить высоту на 3 интервала (группы) не более, …

2
получение степеней свободы от лмера
Я подобрал модель lmer со следующим (хотя и скомпонованным выводом): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 Я действительно хотел бы построить доверительный интервал для каждого эффекта, используя следующую формулу: (n−1)s2χ2α/2,n−1,(n−1)s2χ21−α/2,n−1(n−1)s2χα/2,n−12,(n−1)s2χ1−α/2,n−12 \frac{(n-1)s^2}{\chi^2_{\alpha/2, n-1}},\frac{(n-1)s^2}{\chi^2_{1-\alpha/2,n-1}} Есть ли способ удобно выбрать степени свободы?

2
Вывод нормального желтоватого покрова
Я работаю над выводом апостола Normal-Wishart, но я застрял на одном из параметров (апостериор матрицы шкалы, см. Внизу). Просто для контекста и полноты, вот модель и остальные выводы: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} Расширенные формы каждого из трех факторов (с …

1
Модель смешанного эффекта с переменной выборки
Я пытаюсь указать формулу для линейной модели смешанного эффекта (с lme4) для моего экспериментального дизайна, но я не уверен, что я делаю это правильно. Дизайн: в основном я измеряю параметр отклика на растениях. У меня 4 уровня лечения и 2 уровня орошения. Растения сгруппированы в 16 участков, в пределах каждого …

3
Как провести факторный анализ, если ковариационная матрица не является положительно определенной?
У меня есть набор данных, который состоит из 717 наблюдений (строк), которые описываются 33 переменными (столбцами). Данные стандартизируются путем z-оценки всех переменных. Нет двух переменных линейно зависимых ( ). Я также удалил все переменные с очень низкой дисперсией (менее ). На рисунке ниже показана соответствующая матрица корреляции (в абсолютных значениях).r=1r=1r=10.10.10.1 …

1
порог расчета для минимального классификатора риска?
Предположим, что два класса и имеют атрибут и имеют распределение и . если мы имеем равный для следующей матрицы затрат:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} почему x0&lt;0.5x0&lt;0.5x_0 < 0.5 является порогом для классификатора минимального риска (стоимости)? Это мой пример …

1
Как выбрать наилучшее соответствие без чрезмерных данных? Моделирование бимодального распределения с N нормальными функциями и т. Д.
У меня есть явно бимодальное распределение значений, которое я стараюсь соответствовать. Данные могут хорошо соответствовать либо 2 нормальным функциям (бимодальным), либо 3 нормальным функциям. Кроме того, существует вероятная физическая причина для сопоставления данных с 3. Чем больше параметров введено, тем более идеальным будет соответствие, поскольку при достаточном количестве констант можно …

3
«Обратный» Шапиро – Вилк
Тест Шарипо-Вилка, согласно википедии , проверяет нулевую гипотезу ( ) «Население обычно распределено».ЧАС0ЧАС0H_0 Я ищу похожий тест на нормальность с «Население обычно не распределено».ЧАС0ЧАС0H_0 Имея такой тест, я хочу вычислить значение, чтобы отклонить H 0 на уровне значимости α тогда и только тогда, когда p &lt; α ; доказывая, что …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.