Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Расхождение Кульбака-Лейблера БЕЗ теории информации
После долгих размышлений о Cross Validated я все еще не чувствую, что я ближе к пониманию дивергенции KL вне области теории информации. Это довольно странно, когда кто-то с математическим образованием находит, что гораздо легче понять объяснение теории информации. Чтобы изложить мое понимание на фоне теории информации: если у нас есть …

2
Можем ли мы использовать MLE для оценки веса нейронной сети?
Я только начал изучать статистику и моделирование вещей. В настоящее время я понимаю, что мы используем MLE, чтобы оценить лучшие параметры для модели. Однако, когда я пытаюсь понять, как работают нейронные сети, кажется, что они обычно используют другой подход для оценки параметров. Почему мы не используем MLE или вообще возможно …

4
У слабых исследований увеличилась вероятность ложных срабатываний?
Этот вопрос уже задавался здесь и здесь, но я не думаю, что ответы касаются вопроса напрямую. У слабых исследований увеличилась вероятность ложных срабатываний? Некоторые новостные статьи делают это утверждение. Для примера : Низкая статистическая мощность - плохая новость. Слабые исследования, скорее всего, пропустят подлинные эффекты, и как группа, они с …

6
Ошибка стрелка из Техаса в анализе поисковых данных
Я читал эту статью в Природе, в которой некоторые ошибки объясняются в контексте анализа данных. Я заметил, что ошибки техасского снайпера было особенно трудно избежать: Когнитивная ловушка, которая ожидает во время анализа данных, проиллюстрирована басней о техасском снайпере: неумелый меткий стрелок, который стреляет случайным образом из пуль сбоку сарая, рисует …
23 eda  fallacy 

4
Введение в машинное обучение для математиков
В каком-то смысле это мой перекрестный пост от math.stackexchange , и у меня есть ощущение, что этот сайт может обеспечить широкую аудиторию. Я ищу математическое введение в машинное обучение. В частности, много литературы, которая может быть найдена, является относительно неточной, и многие страницы тратятся без какого-либо содержания. Однако, исходя из …

3
Какова архитектура сложного сверточного автоэнкодера?
Поэтому я пытаюсь провести предварительную подготовку на изображениях людей, используя сверточные сети. Я прочитал документы ( Paper1 и Paper2 ) и эту ссылку на переполнение стека , но я не уверен, что понимаю структуру сетей (она не очень хорошо определена в статьях). Вопросов: Я могу сделать так, чтобы за моим …

2
Разница двух iid логнормальных случайных величин
Пусть и X 2 будут 2 iidrv, где log ( X 1 ) , log ( X 2 ) ∼ N ( μ , σ ) . Я хотел бы знать распределение для X 1 - X 2 .X1X1X_1X2X2X_2log(X1),log(X2)∼N(μ,σ)log⁡(X1),log⁡(X2)∼N(μ,σ)\log(X_1),\log(X_2) \sim N(\mu,\sigma)X1−X2X1−X2X_1 - X_2 Лучшее, что я могу сделать, - это …

4
Биномиальный тест с двумя пропорциями выборки в R (и некоторые странные p-значения)
Я пытаюсь решить следующий вопрос: Игрок A выиграл 17 из 25 игр, а игрок B выиграл 8 из 20 - есть ли значительная разница между обоими соотношениями? В R приходит на ум следующее: > prop.test(c(17,8),c(25,20),correct=FALSE) 2-sample test for equality of proportions without continuity correction data: c(17, 8) out of c(25, …

1
Нелинейная или обобщенная линейная модель: как вы относитесь к логистической, пуассоновской и т. Д. Регрессии?
У меня есть вопрос о семантике, о котором я хотел бы узнать мнение коллег-статистиков. Мы знаем, что такие модели, как логистика, Пуассон и т. Д. Подпадают под действие обобщенных линейных моделей. Модель включает в себя нелинейные функции параметров, которые, в свою очередь, могут быть смоделированы с использованием структуры линейной модели …

3
MSE разложение до дисперсии и смещения в квадрате
Показывая, что MSE можно разложить на дисперсию плюс квадрат смещения, доказательство в Википедии имеет шаг, выделенный на рисунке. Как это работает? Как ожидание подталкивается к продукту с 3-го шага до 4-го шага? Если два условия независимы, разве ожидание не должно применяться к обоим условиям? и если они не, этот шаг …

1
Есть ли способ использовать ковариационную матрицу для нахождения коэффициентов множественной регрессии?
Для простой линейной регрессии коэффициент регрессии вычисляется непосредственно из дисперсионно-ковариационной матрицы , используя где - индекс зависимой переменной, а - индекс объясняющей переменной.CCCCd,eCe,eCd,eCe,e C_{d, e}\over C_{e,e} dddeee Если есть только ковариационная матрица, можно ли рассчитать коэффициенты для модели с несколькими объясняющими переменными? ETA: кажется, что для двух объясняющих переменных и …

6
Почему мы обычно выбираем минимизацию суммы квадратичных ошибок (SSE) при подборе модели?
Вопрос очень прост: почему, когда мы пытаемся приспособить модель к нашим данным, линейным или нелинейным, мы обычно пытаемся минимизировать сумму квадратов ошибок, чтобы получить нашу оценку для параметра модели? Почему бы не выбрать другую целевую функцию, чтобы минимизировать? Я понимаю, что по техническим причинам квадратичная функция лучше, чем некоторые другие …

2
В чем разница между функцией потерь и функцией принятия решений?
Я вижу, что обе функции являются частью методов интеллектуального анализа данных, таких как Gradient Boosting Regressors. Я вижу, что это тоже отдельные объекты. Каковы отношения между обоими в целом?

7
Что не так с настройками Бонферрони?
Я прочитал следующую статью: Perneger (1998) Что не так с корректировками Бонферрони . В заключение автор сказал, что корректировка Бонферрони в лучшем случае имеет ограниченное применение в биомедицинских исследованиях и не должна использоваться при оценке доказательств конкретной гипотезы: Сводные моменты: Корректировка статистической значимости для количества тестов, которые были выполнены на …

10
Есть ли у вас рекомендации для книг по самостоятельному обучению прикладной статистике на уровне выпускников?
В колледже я прошел несколько курсов по статистике, но обнаружил, что мое образование основано на теории. Мне было интересно, есть ли у кого-нибудь из вас текст в Прикладной статистике (на уровне выпускника), который вы рекомендуете, или у вас был хороший опыт.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.