Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Почему множественные гипотезы не применяются ко всем экспериментам с незапамятных времен?
Мы знаем, что мы должны применять поправки Бенджамини-Хохберга для проверки нескольких гипотез к экспериментам, основанным на одном наборе данных, чтобы контролировать частоту ложных открытий, иначе все эксперименты, которые дают положительный результат, могут быть ложными. Но почему мы не применяем этот же принцип ко всем экспериментам с начала времен, независимо от …

3
Оценка логистической регрессии и интерпретации Хосмера-Лемешоу Goodness of Fit
Как мы все знаем, есть 2 метода для оценки модели логистической регрессии, и они тестируют очень разные вещи Прогнозирующая сила: Получите статистику, которая измеряет, насколько хорошо вы можете предсказать зависимую переменную на основе независимых переменных. Хорошо известными псевдо R ^ 2 являются Макфадден (1974) и Кокс и Снелл (1989). Статистика …

2
Парадокс данных iid (по крайней мере для меня)
Насколько позволяют мои совокупные (и скудные) знания по статистике, я понял, что если - это случайные переменные, то, как следует из этого термина, они независимы и одинаково распределены.X1,X2,...,XnX1,X2,...,XnX_1, X_2,..., X_n Здесь меня интересует прежнее свойство примеров iid, которое гласит: p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(Xn|Xi1,Xi2,...,Xik)=p(Xn),p(X_{n}|X_{i_1},X_{i_2},...,X_{i_k}) = p(X_{n}), для любой коллекции различных s st . 1 …

2
Мешок слов для классификации текста: почему бы просто не использовать частоты слов вместо TFIDF?
Распространенным подходом к классификации текста является тренировка классификатора из «мешка слов». Пользователь берет текст, который должен быть классифицирован, и подсчитывает частоты слов в каждом объекте, после чего следует какое-то усечение, чтобы сохранить результирующую матрицу контролируемого размера. Часто я вижу, как пользователи строят свой вектор признаков, используя TFIDF. Другими словами, частоты …

4
ANOVA против множественной линейной регрессии? Почему ANOVA так часто используется в экспериментальных исследованиях?
ANOVA против множественной линейной регрессии? Я понимаю, что оба эти метода, похоже, используют одну и ту же статистическую модель. Однако при каких обстоятельствах я должен использовать какой метод? Каковы преимущества и недостатки этих методов при сравнении? Почему ANOVA так часто используется в экспериментальных исследованиях, а я вряд ли когда-нибудь найду …

4
Что мы можем узнать о человеческом мозге из искусственных нейронных сетей?
Я знаю, что мой вопрос / название не очень конкретны, поэтому я постараюсь прояснить это: Искусственные нейронные сети имеют относительно строгий дизайн. Конечно, как правило, они находятся под влиянием биологии и пытаются построить математическую модель реальных нейронных сетей, но нашего понимания реальных нейронных сетей недостаточно для построения точных моделей. Поэтому …

3
Почему силовые или логарифмические преобразования не преподаются в машинном обучении?
Машинное обучение (ML) активно использует методы линейной и логистической регрессии. Он также опирается на особенность инженерных методов ( feature transform, kernel, и т.д.). Почему нет ничего о variable transformation(например power transformation) , упомянутые в ML? (Например, я никогда не слышал о получении root или log к объектам, они обычно просто …

1
Можно ли охарактеризовать многочлен (1 / n,…, 1 / n) как дискретный Дирихле (1, .., 1)?
Так что этот вопрос немного запутанный, но я добавлю красочные графики, чтобы восполнить это! Сначала предыстория, затем вопрос (ы). Задний план Скажем, у вас есть мерное полиномиальное распределение с равными вероятностями по категориям. Пусть - нормализованные значения ( ) из этого распределения, то есть:nnnnnnπ=(π1,…,πn)π=(π1,…,πn)\pi = (\pi_1, \ldots, \pi_n)ccc (c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c1,…,cn)∼Multinomial(1/n,…,1/n)πi=cin(c_1, \ldots, …

1
Какова вероятность того, что случайных точек в измерениях линейно разделимы?
Для точек данных, каждая из которых имеет признаков, помечены как , остальные помечены как . Каждый признак принимает значение от случайным образом (равномерное распределение). Какова вероятность того, что существует гиперплоскость, которая может разделить два класса?Nnndddн / 2n/2n/2000н / 2n/2n/2111[ 0 , 1 ][0,1][0,1] Давайте сначала рассмотрим самый простой случай, т.е. …

4
Алгоритмы обнаружения аномалий временных рядов
В настоящее время я использую AnomalyDetection от Twitter в R: https://github.com/twitter/AnomalyDetection . Этот алгоритм обеспечивает обнаружение аномалий временных рядов для данных с сезонностью. Вопрос: есть ли другие алгоритмы, подобные этому (контроль сезонности не имеет значения)? Я пытаюсь набрать как можно больше алгоритмов временных рядов на своих данных, чтобы я мог …


2
Байесовское лассо против обычного лассо
Различное программное обеспечение реализации доступно для лассо . Я знаю, что много обсуждали байесовский подход против частого подхода на разных форумах. Мой вопрос очень специфичен для лассо - каковы различия или преимущества ласио Байса против обычного лассо ? Вот два примера реализации в пакете: # just example data set.seed(1233) X …

2
Автоэнкодеры не могут выучить значимые функции
У меня есть 50000 изображений, таких как эти два: Они изображают графики данных. Я хотел извлечь функции из этих изображений, поэтому я использовал код автоэнкодера, предоставленный Theano (deeplearning.net). Проблема в том, что эти автоэнкодеры, похоже, не изучают никаких функций. Я попробовал RBM, и это то же самое. Набор данных MNIST …

1
Геометрическая интерпретация коэффициента множественной корреляции и коэффициента детерминации
Меня интересует геометрический смысл множественной корреляции и коэффициента детерминации в регрессии или в векторной записи,R 2 y i = β 1 + β 2 x 2 , i + ⋯ + β k x k , i + ϵ iRRRR2R2R^2yi=β1+β2x2,i+⋯+βkxk,i+ϵiyi=β1+β2x2,i+⋯+βkxk,i+ϵiy_i = \beta_1 + \beta_2 x_{2,i} + \dots + \beta_k x_{k,i} …

5
Примеры PCA, где ПК с низкой дисперсией «полезны»
Обычно в анализе главных компонентов (PCA) используются первые несколько ПК, а ПК с низкой дисперсией отбрасываются, поскольку они не объясняют большую часть различий в данных. Тем не менее, есть ли примеры, когда ПК с малой вариацией полезны (то есть используются в контексте данных, имеют интуитивное объяснение и т. Д.) И …
24 pca 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.