Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Байесовское мышление о переоснащении
Я посвятил много времени разработке методов и программного обеспечения для проверки прогностических моделей в традиционной статистической области. Внедряя больше байесовских идей в практику и обучая, я вижу некоторые ключевые отличия, которые следует принять Во-первых, байесовское прогнозирующее моделирование требует от аналитика тщательно продумать предыдущие распределения, которые могут быть адаптированы к возможностям-кандидатам, …

1
Разница между отсутствующими данными и разреженными данными в алгоритмах машинного обучения
Каковы основные различия между разреженными данными и отсутствующими данными? И как это влияет на машинное обучение? В частности, как редкие и отсутствующие данные влияют на алгоритмы классификации и регрессионные (прогнозирующие числа) типы алгоритмов. Я говорю о ситуации, когда процент пропущенных данных значителен, и мы не можем удалить строки, содержащие пропущенные …

5
Почему работает особенность инженерии?
Недавно я узнал, что одним из способов найти лучшее решение проблем ОД является создание функций. Это можно сделать, например, суммируя две особенности. Например, мы обладаем двумя функциями «атака» и «защита» какого-то героя. Затем мы создаем дополнительную функцию под названием «общее», которая представляет собой сумму «атаки» и «защиты». Теперь, что мне …

2
Как имеет смысл делать OLS после выбора переменной LASSO?
Недавно я обнаружил, что в литературе по прикладной эконометрике, когда речь идет о проблемах выбора признаков, нередко выполняется LASSO с последующей регрессией OLS с использованием выбранных переменных. Мне было интересно, как мы можем квалифицировать обоснованность такой процедуры. Это вызовет проблемы, такие как пропущенные переменные? Какие-либо доказательства того, что это более …

2
Что является / является неявным приоритетом в статистике частых посещений?
Я слышал, что Джейнс утверждает, что часто работающие работают с «неявным априором». Каковы или являются эти неявные приоры? Означает ли это, что модели для частых - все это особые случаи байесовских моделей, которые ждут своего появления?

2
Что в названии: Точность (обратная дисперсия)
Интуитивно понятно, что среднее - это просто среднее из наблюдений. Разница заключается в том, насколько эти наблюдения отличаются от среднего значения. Я хотел бы знать, почему обратная дисперсия называется точностью. Какую интуицию мы можем извлечь из этого? И почему матрица точности так же полезна, как ковариационная матрица в многомерном (нормальном) …

2
От равномерного распределения к экспоненциальному распределению и наоборот
Вероятно , это тривиальный вопрос, но мой поиск был бесплодном до сих пор, в том числе этой статьи в Википедии , и «Compendium распределений» документ . Если имеет равномерное распределение, означает ли это, что следует экспоненциальному распределению?e XXXXeXeXe^X Аналогично, если следует экспоненциальному распределению, означает ли это, что следует равномерному распределению?l …

4
Разница между обратной связью RNN и LSTM / GRU
Я пытаюсь понять различные архитектуры рекуррентных нейронных сетей (RNN), которые должны применяться к данным временных рядов, и меня немного путают с разными именами, которые часто используются при описании RNN. Является ли структура долгосрочной кратковременной памяти (LSTM) и Gated Recurrent Unit (GRU) по сути RNN с контуром обратной связи?

3
Как правильно использовать раннюю остановку для тренировки глубокой нейронной сети?
У меня есть модель глубокой нейронной сети, и мне нужно обучить ее на моем наборе данных, который состоит из около 100 000 примеров, мои данные проверки содержат около 1000 примеров. Поскольку для обучения каждого примера требуется время (около 0,5 с для каждого примера) и во избежание переобучения, я хотел бы …

2
В нейронных сетях зачем использовать градиентные методы, а не другие метаэвристики?
Почему в обучении глубоких и неглубоких нейронных сетей обычно используются градиентные методы (например, градиентный спуск, Нестеров, Ньютон-Рафсон), а не другие метаэвристики? Под метаэвристикой я подразумеваю такие методы, как имитация отжига, оптимизация колоний муравьев и т. Д., Которые были разработаны, чтобы избежать застревания в локальных минимумах.

2
Понимание происхождения компромисса смещения дисперсии
Я читаю главу о компромиссах смещения дисперсии элементов статистического обучения, и у меня есть сомнения в формуле на стр. 29. Пусть данные возникают из такой модели, что где - случайный число с ожидаемым значением и дисперсией . Пусть ожидаемое значение ошибки модели составляет где - это предсказание нашего ученика. Согласно …

1
Как LDA, метод классификации, также служит методом уменьшения размерности, как PCA
В этой статье автор связывает линейный дискриминантный анализ (LDA) с анализом главных компонентов (PCA). С моими ограниченными знаниями я не могу понять, как LDA может быть чем-то похожим на PCA. Я всегда думал, что LDA - это форма алгоритма классификации, похожая на логистическую регрессию. Я буду признателен за помощь в …

2
Какие методы оптимизации лучше всего подходят для LSTM?
Я использовал theano для экспериментов с LSTM, и мне было интересно, какие методы оптимизации (SGD, Adagrad, Adadelta, RMSprop, Adam и т. Д.) Лучше всего подходят для LSTM? Есть ли исследовательские работы на эту тему? Кроме того, зависит ли ответ от типа приложения, для которого я использую LSTM? Если это так, …

2
Остаточные графики: почему график в зависимости от установленных значений, а не наблюдаемых значений
В контексте регрессии OLS я понимаю, что остаточный график (в сравнении с установленными значениями) обычно рассматривается для проверки на постоянную дисперсию и оценки спецификации модели. Почему остатки отображаются в зависимости от подгонки, а не от значений ? Как информация отличается от этих двух графиков?YYY Я работаю над моделью, которая произвела …

4
Кластеризация корреляционной матрицы
У меня есть корреляционная матрица, в которой указано, как каждый элемент соотносится с другим элементом. Следовательно, для N элементов у меня уже есть N * N корреляционная матрица. Используя эту корреляционную матрицу, как кластеризовать N элементов в M бинах, чтобы я мог сказать, что Nk элементов в k-ом бине ведут …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.