Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Каковы известные, существующие практические применения теории хаоса в интеллектуальном анализе данных?
Случайно читая некоторые работы массового рынка по теории хаоса за последние несколько лет, я начал задаваться вопросом, как различные аспекты этого могут быть применены к интеллектуальному анализу данных и смежным областям, таким как нейронные сети, распознавание образов, управление неопределенностью и т. Д. На сегодняшний день я В опубликованном исследовании мы …

3
Как модели машинного обучения (GBM, NN и т. Д.) Можно использовать для анализа выживания?
Я знаю, что традиционные статистические модели, такие как регрессия пропорциональных рисков Кокса и некоторые модели Каплана-Мейера, могут использоваться для прогнозирования дней до следующего возникновения события, скажем, провала и т. Д., Т. Е. Анализа выживания Вопросов Как можно использовать регрессионную версию моделей машинного обучения, таких как GBM, нейронные сети и т. …

2
Докажите, что максимальное распределение энтропии с фиксированной ковариационной матрицей является гауссовым
Я пытаюсь обдумать следующее доказательство того, что гауссиан обладает максимальной энтропией. Как помеченный шаг имеет смысл? Определенная ковариация только фиксирует второй момент. Что происходит с третьим, четвертым, пятым моментами и т. Д.?

2
Объяснение Леймана цензуры в анализе выживания
Я читал о том, что такое цензура и как ее следует учитывать при анализе выживания, но мне хотелось бы услышать менее математическое определение и более интуитивное определение (картинки были бы хорошими!). Может ли кто-нибудь дать мне объяснение 1) цензуры и 2) как это влияет на такие вещи, как кривые Каплана-Мейера …

1
Смещение дисперсии
В разделе 3.2 Бишопа «Распознавание образов и машинное обучение» он обсуждает разложение смещения дисперсии, утверждая, что для квадрата функции потерь ожидаемая потеря может быть разложена на квадрат смещения (который описывает, насколько средние прогнозы далеки от истинных модель), дисперсионный термин (который описывает разброс прогнозов вокруг среднего) и шумовой термин (который дает …

1
Оценить случайный лес: OOB против CV
Когда мы оцениваем качество случайного леса, например, с использованием AUC, более ли уместно вычислять эти количества по образцам «из пакета» или по совокупности перекрестной проверки? Я слышал, что вычисление его по образцам OOB дает более пессимистическую оценку, но я не понимаю, почему.

4
Графические небольшие образцы
У меня есть небольшой набор данных 14 раз для выполнения задачи. Однако у меня возникают трудности с поиском подходящего графика для использования в графике данных. Если бы образец был больше, я бы использовал коробочную диаграмму или гистограмму, но я не уверен, что было бы целесообразно использовать в этом случае, когда …


1
Теорема Байеса с кратными условиями
Я не понимаю, как это уравнение было получено. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} Это уравнение было взято из статьи «Испытание по вероятности», где случай О.Дж. Симпсона был приведен в качестве примера задачи. Обвиняемый находится под следствием за двойное убийство, и против него представлены два доказательства. M1M1M_{1} - это случай, когда …

1
Почему Даниэль Уилкс (2011) говорит, что регресс основного компонента «будет предвзятым»?
В « Статистических методах в атмосферных науках» Дэниел Уилкс отмечает, что множественная линейная регрессия может привести к проблемам, если между предикторами существуют очень сильные корреляции (3-е издание, стр. 559-560): Патология, которая может возникнуть при множественной линейной регрессии, состоит в том, что набор переменных-предикторов, имеющих сильные взаимные корреляции, может привести к …
13 regression  pca  bias 

1
ANOVA полагается на метод моментов, а не на максимальную вероятность?
Я вижу упомянутое в разных местах, что ANOVA делает оценку, используя метод моментов. Меня смущает это утверждение, потому что, хотя я не знаком с методом моментов, я понимаю, что это нечто отличное от метода максимальной вероятности и не эквивалентное ему; с другой стороны, ANOVA можно рассматривать как линейную регрессию с …


2
Является ли прогноз «золотым критерием» для оценки способности статистиков?
Я читал линейные модели Faraway из учебника с R (1-е издание) в прошлые выходные. У Faraway была глава под названием «Статистическая стратегия и модель неопределенности». Он описал (стр 158) , что он искусственно созданный некоторые данные , используя очень сложную модель, то он попросил своих студентов моделировать данные и сравнить …

1
Современное состояние совместной фильтрации
Я работаю над проектом для совместной фильтрации (CF), т.е. завершаю частично наблюдаемую матрицу или, в более общем случае, тензор. Я новичок в этой области, и для этого проекта, в конце концов, мне нужно сравнить наш метод с другими известными, которые в настоящее время сравнивают предложенные методы с ними, а именно, …

1
Шансы стали проще
У меня возникли проблемы с пониманием шансов, и я хотел бы просто объяснить, как их интерпретировать. Я нашел различные сообщения, связанные с коэффициентами, но большинство из них более сложны, чем то, что я пытаюсь понять. Вот пример того, как я интерпретирую шансы: если шансы события происходят 3 к 1, то …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.