Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Неправильно ли выбирать функции на основе p-значения?
Есть несколько постов о том, как выбирать функции. Один из методов описывает важность функции на основе t-статистики. В R, varImp(model)примененном к линейной модели со стандартизованными характеристиками, используется абсолютное значение t-статистики для каждого параметра модели. Итак, в основном мы выбираем функцию на основе ее t-статистики, то есть, насколько точным является коэффициент. …

2
Как использовать фильтр Калмана?
У меня есть траектория объекта в 2D-пространстве (поверхности). Траектория задается в виде последовательности (x,y)координат. Я знаю, что мои измерения шумят, и иногда у меня есть очевидные выбросы. Итак, я хочу отфильтровать свои наблюдения. Насколько я понял фильтр Калмана, он делает именно то, что мне нужно. Итак, я пытаюсь использовать это. …


2
График QQ выглядит нормально, но тест Шапиро-Вилка говорит об обратном
В R у меня есть выборка из 348 мер, и я хочу знать, могу ли я предположить, что она обычно распространяется для будущих тестов. По сути, следуя другому ответу из стека , я смотрю на график плотности и график QQ: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) У меня нет большого опыта …

3
Почему мы используем PCA для ускорения алгоритмов обучения, когда мы можем просто уменьшить количество функций?
В курсе машинного обучения я узнал, что одним из распространенных применений PCA ( анализ основных компонентов ) является ускорение других алгоритмов машинного обучения. Например, представьте, что вы тренируете модель логистической регрессии. Если у вас есть обучающий набор для i от 1 до n, и оказывается, что размер вашего вектора x …

2
Градиентный спуск не находит решения для обычных наименьших квадратов в этом наборе данных?
Я изучал линейную регрессию и попробовал ее на приведенном ниже множестве {(x, y)}, где x указал площадь дома в квадратных футах, а y - цену в долларах. Это первый пример в Andrew Ng Notes . 2104.400 1600.330 2400.369 1416.232 3000.540 Я разработал пример кода, но когда я его запускаю, стоимость …

2
Почему для воспроизведения опыта требуется алгоритм вне политики?
В документе, представляющем DQN « Игра Atari с глубоким обучением подкреплению », упоминалось: Обратите внимание, что при обучении с помощью повторного опыта необходимо учиться вне политики (поскольку наши текущие параметры отличаются от тех, которые используются для генерации образца), что мотивирует выбор Q-обучения. Я не совсем понял, что это значит. Что …

2
Что такое регулярности и регуляризация?
Я слышу эти слова все больше и больше, когда изучаю машинное обучение. Фактически, некоторые люди выиграли медаль Филдса, работающую над закономерностями уравнений. Итак, я думаю, что это термин, который переносится от статистической физики / математики к машинному обучению. Естественно, некоторые люди, которых я спросил, просто не могли это интуитивно объяснить. …

2
Как решить наименьшее абсолютное отклонение симплекс-методом?
Вот проблема наименьшего абсолютного отклонения в данной области:, Я знаю, что это может быть перестроено как проблема LP следующим образом:argminwL(w)=∑ni=1|yi−wTx|arg⁡minwL(w)=∑i=1n|yi−wTx| \underset{\textbf{w}}{\arg\min} L(w)=\sum_{i=1}^{n}|y_{i}-\textbf{w}^T\textbf{x}| min∑ni=1uimin∑i=1nui\min \sum_{i=1}^{n}u_{i} ui≥xTw−yii=1,…,nui≥xTw−yii=1,…,nu_i \geq \textbf{x}^T\textbf{w}- y_{i} \; i = 1,\ldots,n ui≥−(xTw−yi)i=1,…,nui≥−(xTw−yi)i=1,…,nu_i \geq -\left(\textbf{x}^T\textbf{w}-y_{i}\right) \; i = 1,\ldots,n Но я понятия не имею, чтобы решить это шаг за шагом, …


4
Как рассчитать доверительные интервалы для соотношений?
Рассмотрим эксперимент, который выводит отношение между 0 и 1. То, как это соотношение получается, не должно быть уместным в этом контексте. Он был разработан в предыдущей версии этого вопроса , но удален для ясности после обсуждения мета .ИксяXiX_i Этот эксперимент повторяется раз, пока мало (около 3-10). Предполагается, что независимы и …

2
Надежность режима из образца MCMC
В своей книге «Анализ байесовских данных» Джон Крушке утверждает, что при использовании JAGS из R ... оценка режима из выборки MCMC может быть довольно нестабильной, поскольку оценка основана на алгоритме сглаживания, который может быть чувствителен к случайным ударам и пульсациям в выборке MCMC. ( Выполнение байесовского анализа данных , стр. …
12 bayesian  mcmc  mode 


1
Можно ли концептуально понять модель Парето / nbd?
Я учусь использовать пакет BTYD, который использует модель Парето / NBD, чтобы предсказать, когда клиент вернется. Тем не менее, вся литература по этой модели полна математики, и, похоже, нет простого / концептуального объяснения работы этой модели. Можно ли понять модель Парето / NBD для нематематиков? Я прошел через эту знаменитую …

1
Что такое многомерные ортогональные полиномы, вычисленные в R?
Ортогональные многочлены в одномерном наборе точек - это многочлены, которые производят значения в этих точках таким образом, что их произведение точек и попарная корреляция равны нулю. R может создавать ортогональные многочлены с функцией poly . Эта же функция имеет вариант polym, который создает ортогональные полиномы на множестве многовариантных точек. В …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.