Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Распределение разницы между двумя нормальными распределениями
У меня есть две функции плотности вероятности нормальных распределений: f1(x1|μ1,σ1)=1σ12π−−√e−(x−μ1)22σ21f1(x1|μ1,σ1)=1σ12πe−(x−μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } и f2(x2|μ2,σ2)=1σ22π−−√e−(x−μ2)22σ22f2(x2|μ2,σ2)=1σ22πe−(x−μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = \frac{1}{\sigma_2\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_2)^2}{2\sigma_2^2} } Я ищу функцию плотности вероятности разделения между и . Я думаю, это означает, что …

1
Должен ли я принимать решения на основе микро-усредненных или макро-усредненных мер оценки?
Я провел 10-кратную перекрестную проверку по различным алгоритмам двоичной классификации с одним и тем же набором данных и получил результаты, усредненные как на микро-, так и на макроуровне. Следует отметить, что это была проблема классификации по нескольким меткам. В моем случае истинные негативы и истинные позитивы взвешиваются одинаково. Это означает, …

1
Почему квазипуассон в GLM не рассматривается как частный случай отрицательного бинома?
Я пытаюсь приспособить обобщенные линейные модели к некоторым наборам данных подсчета, которые могут быть или не быть перераспределены. Здесь применимы два канонических распределения: Пуассон и Отрицательный бином (Негбин) с EV и дисперсией.μμ\mu Вгп= μВaрпзнак равноμVar_P = \mu ВгNВ= μ + μ2θВaрNВзнак равноμ+μ2θVar_{NB} = \mu + \frac{\mu^2}{\theta} которые могут быть установлены …


3
Странные корреляции в результатах SVD случайных данных; у них есть математическое объяснение или это ошибка LAPACK?
Я наблюдаю очень странное поведение в результате SVD случайных данных, которое я могу воспроизвести как в Matlab, так и в R. Это похоже на некоторую числовую проблему в библиотеке LAPACK; это? Я рисую выборок из мерного гауссиана с нулевым средним и единичной ковариацией: . Я собрать их в данных матрица …

4
Почему смешанные данные являются проблемой для евклидовых алгоритмов кластеризации?
Большинство классических алгоритмов кластеризации и уменьшения размерности (иерархическая кластеризация, анализ главных компонентов, k-средних, самоорганизующиеся карты ...) разработаны специально для числовых данных, а их входные данные рассматриваются как точки в евклидовом пространстве. Это, конечно, проблема, поскольку многие вопросы реального мира включают в себя данные, которые смешаны: например, если мы изучаем автобусы, …

4
Как проверить, является ли мой дистрибутив мультимодальным?
Когда я строю гистограмму моих данных, она имеет два пика: Означает ли это потенциальное мультимодальное распределение? Я запустил dip.testв R ( library(diptest)), и вывод: D = 0.0275, p-value = 0.7913 Я могу заключить, что мои данные имеют мультимодальное распределение? ДАННЫЕ 10346 13698 13894 19854 28066 26620 27066 16658 9221 13578 …

3
Значение «количества параметров» в AIC
При вычислении AIC, AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k означает «количество параметров». Но что считается параметром? Так, например, в модели y=ax+by=ax+by = ax + b A и b всегда считаются параметрами? Что если мне не важно значение перехвата, могу ли я его игнорировать или он все еще считается? …
21 aic 

2
В простой линейной регрессии, откуда берется формула для дисперсии остатков?
Согласно тексту, который я использую, формула для дисперсии остатка определяется как:ithithi^{th} σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) Я нахожу это трудно поверить , так как остаточная разница между наблюдаемым значением и подогнанной значения; если бы вычислить дисперсию разницы, по крайней мере я бы ожидал некоторых «плюсов» в результирующем выражении. Любая помощь …

4
Как рассчитать доверительные интервалы для ненормального распределения?
У меня 383 выборки с большим смещением для некоторых распространенных значений. Как рассчитать 95% ДИ для среднего значения? CI, который я рассчитал, кажется далёким, и я предполагаю, что мои данные не выглядят как кривая, когда я делаю гистограмму. Так что я думаю, что должен использовать что-то вроде начальной загрузки, что …


2
Как описать или визуализировать модель множественной линейной регрессии
Я пытаюсь приспособить модель множественной линейной регрессии к моим данным с помощью пары входных параметров, скажем, 3. F( х )F( х )= A x1+ B x2+ CИкс3+ дили= ( A B C )Т( х1 Икс2 Икс3) + d(я)(II)(я)F(Икс)знак равноAИкс1+ВИкс2+СИкс3+dили(II)F(Икс)знак равно(A В С)Т(Икс1 Икс2 Икс3)+d\begin{align} F(x) &= Ax_1 + Bx_2 + …

2
Что подразумевается под стандартной ошибкой оценки максимального правдоподобия?
Я математик, самостоятельно изучающий статистику и особенно борющийся с языком. В книге, которую я использую, есть следующая проблема: Случайная переменная задается как распределяется с . (Конечно, для этого вопроса можно взять любое распределение в зависимости от одного параметра.) Затем приводится выборка из пяти значений , , , , .Парето ( …

2
Если кластеризация k-средних является формой моделирования гауссовой смеси, можно ли ее использовать, когда данные не являются нормальными?
Я читаю Бишопа об алгоритме EM для GMM и взаимосвязи между GMM и k-means. В этой книге говорится, что k-means - это жестко заданная версия GMM. Мне интересно, означает ли это, что если данные, которые я пытаюсь кластеризовать, не являются гауссовыми, я не могу использовать k-means (или, по крайней мере, …

1
Два способа использования бутстрапа для оценки доверительного интервала коэффициентов в регрессии
Я применяю линейную модель к своим данным: yi=β0+β1xi+ϵi,ϵi∼N(0,σ2).yi=β0+β1xi+ϵi,ϵi∼N(0,σ2). y_{i}=\beta_{0}+\beta_{1}x_{i}+\epsilon_{i}, \quad\epsilon_{i} \sim N(0,\sigma^{2}). Я хотел бы оценить доверительный интервал (CI) коэффициентов ( , \ beta_ {1} ), используя метод начальной загрузки. Есть два способа применения метода начальной загрузки: β 1β0β0\beta_{0}β1β1\beta_{1} Выборка парного ответа-предиктора: Произвольная повторная выборка пар Yя- хяyi−xiy_{i}-x_{i} и применение …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.