Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


2
Ограничение взаимной информации дает границы точечной взаимной информации
Предположим, у меня есть два набора XXX и YYY и совместное распределение вероятностей по этим наборам p(x,y)p(x,y)p(x,y) . Пусть p(x)p(x)p(x) и p(y)p(y)p(y) обозначают маргинальные распределения по XXX и YYY соответственно. Взаимная информация между XXX и YYY определяется следующим образом: I(X;Y)=∑x,yp(x,y)⋅log(p(x,y)p(x)p(y))I(X;Y)=∑x,yp(x,y)⋅log⁡(p(x,y)p(x)p(y))I(X; Y) = \sum_{x,y}p(x,y)\cdot\log\left(\frac{p(x,y)}{p(x)p(y)}\right) то есть это среднее значение поточечной взаимной …

4
Расчет необходимого размера выборки, точность оценки отклонений?
Фон У меня есть переменная с неизвестным распределением. У меня есть 500 выборок, но я хотел бы продемонстрировать точность, с которой я могу вычислить дисперсию, например, доказать, что размер выборки 500 достаточен. Мне также интересно знать минимальный размер выборки, который потребуется для оценки дисперсии с точностью до .X%X%X\% Вопросов Как …

2
Оценка Джеймса-Стейна: Как Эфрон и Моррис вычислили в коэффициенте усадки для своего примера бейсбола?
У меня есть вопрос о расчете коэффициента усадки Джеймса-Стейна в 1977 году в журнале Scientific American Брэдли Эфрона и Карла Морриса «Парадокс Штейна в статистике» . Я собрал данные для бейсболистов, и они приведены ниже: Name, avg45, avgSeason Clemente, 0.400, 0.346 Robinson, 0.378, 0.298 Howard, 0.356, 0.276 Johnstone, 0.333, 0.222 …


2
Каковы различия между алгоритмом Баум-Уэлча и тренировкой Витерби?
В настоящее время я использую тренировку Витерби для проблемы сегментации изображения. Я хотел знать, в чем преимущества / недостатки использования алгоритма Баума-Уэлча вместо тренировки Витерби.

4
Если мне нужна интерпретируемая модель, существуют ли другие методы, кроме линейной регрессии?
Я сталкивался с некоторыми статистиками, которые никогда не используют модели, кроме линейной регрессии, для прогнозирования, потому что они считают, что «модели ML», такие как случайный лес или повышение градиента, трудно объяснить или «не интерпретируются». В линейной регрессии, учитывая, что набор предположений проверен (нормальность ошибок, гомоскедастичность, отсутствие мультиколлинеарности), t-тесты предоставляют способ …

3
Использование регуляризации при выполнении статистического вывода
Я знаю о преимуществах регуляризации при построении прогностических моделей (смещение против дисперсии, предотвращение переоснащения). Но мне интересно, будет ли хорошей идеей также выполнять регуляризацию (лассо, гребень, упругая сеть), когда основной целью регрессионной модели является вывод на коэффициенты (видя, какие предикторы являются статистически значимыми). Я хотел бы услышать мысли людей, а …

2
Как выполнить специальный тест на модели Lmer?
Это мой фрейм данных: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) Затем я запускаю модель линейно-смешанных эффектов, чтобы сравнить разницу между 3 группами в «Значение», где «Предмет» - случайный фактор: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), data = data) summary(model) Результаты: …
18 r  lme4-nlme  post-hoc 

1
k-NN вычислительная сложность
Какова временная сложность алгоритма k -NN с наивным поисковым подходом (без дерева kd или подобных)? Меня интересует его временная сложность, учитывая также гиперпараметр k . Я нашел противоречивые ответы: O (nd + kn), где n - количество обучающих наборов, а d - размерность каждой выборки. [1] O (ndk), где снова …


3
Ожидаемое количество бросков до появления первой головы
Предположим, что честная монета подбрасывается несколько раз, пока голова не будет получена впервые. Какое ожидаемое количество бросков потребуется? Какое ожидаемое количество хвостов будет получено до получения первой головы?

3
Анализ расхождения Кульбака-Лейблера
Рассмотрим следующие два вероятностных распределения. P Q 0.01 0.002 0.02 0.004 0.03 0.006 0.04 0.008 0.05 0.01 0.06 0.012 0.07 0.014 0.08 0.016 0.64 0.928 Я рассчитал дивергенцию Кульбака-Лейблера, равную , я хочу знать, в целом, что показывает это число? Вообще, дивергенция Кульбака-Лейблера показывает мне, насколько далеко одно распределение вероятностей …

4
Когда байесовские методы предпочтительнее, чем Frequentist?
Я действительно хочу узнать о методах Байеса, поэтому я пытался немного научить себя. Тем не менее, мне трудно понять, когда использование байесовских методов дает преимущество перед методами Frequentist. Например: я видел в литературе немного о том, как некоторые используют информативные приоры, в то время как другие используют неинформативные априорные. Но …

2
Классификация тестирования данных с избыточным дискретизацией
Я работаю над сильно несбалансированными данными. В литературе для перебалансировки данных используется несколько методов с использованием повторной выборки (избыточной или недостаточной выборки). Два хороших подхода: SMOTE: Синтетическая техника пересчёта меньшинств ( SMOTE ) ADASYN: Адаптивный синтетический подход к выборке для несбалансированного обучения ( ADASYN ) Я реализовал ADASYN, потому что …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.