Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Интуитивное объяснение, почему процедура FDR Бенджамини-Хохберга работает?
Есть ли простой способ объяснить, почему процедура Бенджамини и Хохберга (1995) фактически контролирует частоту ложного обнаружения (FDR)? Эта процедура настолько элегантна и компактна, и все же доказательство того, почему она работает в условиях независимости (см. В приложении к статье 1995 года ), не очень доступно.

1
Разница между моделью пересечения или без нее в логистической регрессии
Мне нравится понимать разницу между моделью пересечения или без нее в логистической регрессии Есть ли какая-то разница между ними, за исключением того, что при пересечении коэффициенты относятся к логарифму (коэффициенту шансов) относительно базовой группы, а без пересечения они относятся к логу (коэффициенту)? из того, что я видел, коэффициенты одинаковы в …

2
Scikit правильный способ калибровки классификаторов с CalibratedClassifierCV
Scikit имеет CalibratedClassifierCV , который позволяет нам калибровать наши модели по определенной паре X, Y. В нем также четко указано, чтоdata for fitting the classifier and for calibrating it must be disjoint. Если они должны быть непересекающимися, законно ли обучать классификатор следующим? model = CalibratedClassifierCV(my_classifier) model.fit(X_train, y_train) Я боюсь, что, …

3
Линейная регрессия, что говорит нам статистика F, квадрат R и остаточная стандартная ошибка?
Меня действительно смущает различие в значении относительно контекста линейной регрессии следующих терминов: F статистика R в квадрате Остаточная стандартная ошибка Я нашел эту веб-страницу, которая дала мне отличное понимание различных терминов, связанных с линейной регрессией, однако упомянутые выше термины выглядят довольно много (насколько я понимаю). Я процитирую то, что я …

1
Интервал прогнозирования для биномиальной случайной величины
Какова формула (приблизительная или точная) для интервала предсказания для биномиальной случайной величины? Предположим, что Y∼Binom(n,p)Y∼Binom(n,p)Y \sim \mathsf{Binom}(n, p) , и мы наблюдаем yyy (взятый из YYY ). nnn известно. Наша цель состоит в том, чтобы получить интервал прогнозирования на 95% для нового розыгрыша от YYY . Оценка точка np^np^n\hat{p} , …

2
Какова формула для скорректированного p-значения Бенджамини-Хохберга?
Я понимаю процедуру и то, что она контролирует. Итак, какова формула для скорректированного значения p в процедуре ЧД для множественных сравнений? Только сейчас я понял, что исходная ЧД не выдает скорректированные значения p, а только скорректировала (не) условие отклонения: https://www.jstor.org/stable/2346101 . Гордон Смит в любом случае ввел скорректированные p-значения ЧД …

3
Почему (?) Статистическая выборка должна работать для политики (например, Gallup)?
Опросы, проводимые там (скажем, Gallup), показывают неимоверно низкое количество людей по сравнению с численностью населения (например, возможно, тысяча человек из сотен миллионов). Теперь для меня выборка населения как средство оценки статистики населения имеет смысл, когда у вас есть веские основания полагать, что выборки являются репрезентативными для населения (или, аналогично, других …

4
Интервалы прогнозирования для алгоритмов машинного обучения
Я хочу знать, является ли процесс, описанный ниже, действительным / приемлемым и доступно ли любое обоснование. Идея: контролируемые алгоритмы обучения не предполагают базовых структур / распределений данных. В конце дня они выводят точечные оценки. Я надеюсь как-то количественно оценить неопределенность оценок. Теперь процесс построения модели ML по своей природе является …

2
означает ли оператор (x)?
Я видел оператор do(x)do(x)do(x) везде в обзоре литературы, который я делаю о причинности (см., Например, эту запись в Википедии ). Однако я не могу найти формальное и общее определение этого оператора. Может кто-нибудь указать мне хорошую ссылку на это? Меня интересует общее определение, а не его интерпретация в конкретном эксперименте.

1
Тест Колмогорова – Смирнова против t-критерия
У меня возникли некоторые трудности в понимании интерпретации теста 2S KS и того, чем он отличается от обычного t теста между двумя группами. Допустим, у меня есть мужчины и женщины, выполняющие какое-то задание, и я собираю несколько баллов по этому заданию. Моя конечная цель - определить, по-разному ли мужчины и …

3
Как моделировать большие продольные данные?
Традиционно мы используем смешанную модель для моделирования продольных данных, то есть таких данных, как: id obs age treatment_lvl yield 1 0 11 M 0.2 1 1 11.5 M 0.5 1 2 12 L 0.6 2 0 17 H 1.2 2 1 18 M 0.9 мы можем предположить случайный перехват или …

1
Обобщенные аддитивные модели библиотек Python
Я знаю, что R имеет библиотеки gam и mgcv для обобщенных аддитивных моделей. Но я испытываю трудности с поиском их аналогов в экосистеме Python (у statsmodels есть только прототип в песочнице). Кто-нибудь знает о существующих библиотеках Python? Кто знает, что это может быть хорошим проектом для развития / содействия scikit-learn, …
14 gam 


1
ГАМ против проигрыша против сплайнов
Контекст : Я хочу , чтобы нарисовать линию в диаграмме рассеяния , что не появляется параметрическими, поэтому я использую geom_smooth()в ggplotв R. Он автоматически возвращает geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to …

2
Что такое Тэмпсон Сэмплинг с точки зрения непрофессионала?
Я не могу понять Тэмпсон Сэмплинг и как это работает. Я читал о Multi Arm Bandit и после прочтения Upper Confidence Bound Algorithm многие тексты предположили, что сэмплинг Thompson работает лучше, чем UCB. Что такое Тэмпсон Сэмплинг, с точки зрения непрофессионала или просто? Не стесняйтесь предоставлять справочные статьи для дальнейшего …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.