Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


5
Альтернативы деревьям классификации, с лучшей прогностической (например, CV) эффективностью?
Я ищу альтернативу деревьям классификации, которая могла бы дать лучшую предсказательную силу. Данные, с которыми я имею дело, имеют факторы как для объясняющих, так и для объясненных переменных. Я помню, что сталкивался со случайными лесами и нейронными сетями в этом контексте, хотя никогда не пробовал их раньше, есть ли другой …


2
В чем разница между PCA и асимптотическим PCA?
В двух статьях в 1986 и 1988 годах Коннор и Корайчик предложили подход к моделированию доходности активов. Поскольку у этих временных рядов обычно больше активов, чем наблюдений за временными периодами, они предложили провести PCA по поперечным ковариациям доходности активов. Они называют этот метод Асимптотическим анализом главных компонентов (APCA, что довольно …
23 pca  econometrics 

2
Кластеризация переменных на основе корреляций между ними
Вопросов: У меня большая корреляционная матрица. Вместо того, чтобы кластеризовать отдельные корреляции, я хочу кластеризовать переменные на основе их корреляций друг с другом, т. Е. Если переменная A и переменная B имеют схожие корреляции с переменными C-Z, то A и B должны быть частью одного кластера. Хороший реальный пример этого …

2
Статистическая экспертиза: Бенфорд и не только
Какие существуют широкие методы обнаружения мошенничества, аномалий, фальсификаций и т. Д. В научных работах третьих сторон? (Я был мотивирован, чтобы спросить об этом из-за недавнего романа с Марком Хаузером .) Как правило, для фальсификаций выборов и бухгалтерского учета цитируется какой-то вариант закона Бенфорда . Я не уверен, как это можно …

9
Временные ряды для данных счета, с количеством <20
Недавно я начал работать в туберкулезной клинике. Мы периодически встречаемся, чтобы обсудить количество случаев туберкулеза, которые мы сейчас лечим, количество проведенных тестов и т. Д. Я хотел бы начать моделировать эти показатели, чтобы мы не просто угадали, является ли что-то необычным или нет. К сожалению, у меня было очень мало …

5
Что не так с этим «наивным» алгоритмом тасования?
Это продолжение вопроса Stackoverflow о случайном перемешивании массива . Существуют установленные алгоритмы (такие как Кнут-Фишер-Йейтс Шуффл ), которые следует использовать для перемешивания массива, а не полагаться на «наивные» специальные реализации. Теперь я заинтересован в том, чтобы доказать (или опровергнуть), что мой наивный алгоритм нарушен (как в: не генерирует все возможные …

1
Объяснение min_child_weight в алгоритме xgboost
Определение из min_child_weight параметра в xgboost задается как: минимальная сумма веса экземпляра (гессиана), необходимая ребенку. Если в результате шага разбиения дерева получится листовой узел с суммой веса экземпляра меньше, чем min_child_weight, то процесс сборки прекратит дальнейшее разбиение. В режиме линейной регрессии это просто соответствует минимальному количеству экземпляров, которое должно быть …

1
Какие именно механизмы внимания?
Механизмы внимания использовались в различных документах глубокого обучения в последние несколько лет. Илья Суцкевер, руководитель исследовательского отдела Open AI, с энтузиазмом похвалил их: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Эудженио Кулурчелло из Университета Пердью заявил, что от RNN и LSTM следует отказаться в пользу нейронных сетей, основанных исключительно на внимании: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Это кажется преувеличением, но …

1
Гамильтониан Монте-Карло против последовательного Монте-Карло
Я пытаюсь понять относительные достоинства и недостатки, а также различные области применения этих двух схем MCMC. Когда бы вы использовали, что и почему? Когда один может потерпеть неудачу, а другой нет (например, где применима HMC, но нет SMC, и наоборот) Может ли один, очень наивно предоставленный, поставить меру полезности одному …

2
Почему существуют две разные формулировки / обозначения логистических потерь?
Я видел два типа формулировок логистических потерь. Мы можем легко показать, что они идентичны, единственное отличие - это определение метки .yyy Формулировка / обозначения 1, :y∈{0,+1}y∈{0,+1}y \in \{0, +1\} L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog⁡(p)−(1−y)log⁡(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) где , где логистическая функция отображает действительное число в интервал 0,1.p=11+exp(−βTx)p=11+exp⁡(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)}βTxβTx\beta^T x Формулировка / обозначение 2, :y∈{−1,+1}y∈{−1,+1}y …

3
Является ли высокий
Этот вопрос был перенесен из переполнения стека, потому что на него можно ответить по перекрестной проверке. Мигрировал 4 года назад . В статистике мы делаем линейные регрессии, самые их начала. В общем, мы знаем, что чем выше тем лучше, но существует ли когда-нибудь сценарий, в котором высокий R 2 будет …

2
Почему Laplace ранее производил разреженные решения?
Я просматривал литературу по регуляризации, и часто вижу абзацы, которые связывают регуляризацию L2 с априорным гауссианом и L1 с Лапласом с центром в нуле. Я знаю, как выглядят эти априорные значения, но я не понимаю, как это выражается, например, в весах в линейной модели. В L1, если я правильно понимаю, …

2
Что такое регион с наивысшей плотностью (HDR)?
В статистическом выводе упоминается проблема 9.6b, «Область самой высокой плотности (HDR)». Однако я не нашел определения этого термина в книге. Один подобный термин - Высшая Задняя Плотность (HPD). Но это не вписывается в этот контекст, так как 9.6b ничего не упоминает о предыдущем. И в предлагаемом решении это только говорит …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.