Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Почему это называется «стандартным» отклонением?
У меня есть простой - и, возможно, очевидно тривиальный - вопрос: почему стандартное отклонение называется именно « стандартным »? Это потому, что стандартизирует сравнение наборов данных и результатов в отношении их дисперсии? Поиск в Stack Exchange не поднимает этот вопрос, равно как и поиск в Google по этимологии этого термина …

2
Почему регрессия гребня не сократит некоторые коэффициенты до нуля, как лассо?
При объяснении регрессии LASSO часто используется диаграмма ромба и круга. Говорят, что поскольку форма ограничения в LASSO представляет собой алмаз, полученное решение наименьших квадратов может касаться угла алмаза, так что оно приводит к усадке некоторой переменной. Однако в регрессии гребня, потому что это круг, он часто не будет касаться оси. …

5
Как вы в курсе последних исследований?
Прочитав этот вопрос относительно arXiv и найдя ссылку на GitXiv, о которой я раньше не знал, я подумал, какие веб-сайты / ресурсы используют люди, чтобы быть в курсе последних исследований в своей области?
16 academia 

1
В множественной линейной регрессии, почему график предсказанных точек не лежит на прямой линии?
Я использую множественную линейную регрессию для описания отношений между Y и X1, X2. Из теории я понял, что множественная регрессия предполагает линейные отношения между Y и каждым из X (Y и X1, Y и X2). Я не использую какие-либо преобразования X. Итак, я получил модель с R = 0,45 и …

3
Двухэтапные модели: разница между моделями Хекмана (для выбора образцов) и инструментальными переменными (для работы с эндогенностью)
Я пытаюсь осмыслить разницу между отбором выборки и эндогенностью и, в свою очередь, чем модели Хекмана (для выбора выборки) отличаются от инструментальных переменных регрессий (для решения проблемы эндогенности). Правильно ли говорить, что отбор образцов является специфической формой эндогенности, где эндогенная переменная - это вероятность лечения? Кроме того, мне кажется, что …

1
Пирсон В.С. Остатки отклонений в логистической регрессии
Я знаю, что стандартизированные остатки Пирсона получены традиционным вероятностным способом: ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} и Остаточные отклонения получаются более статистическим способом (вклад каждой точки в вероятность): di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} где = 1, если y i = 1, и s i = -1, …

2
Как сделать прогнозирование с обнаружением выбросов в R? - Процедура и метод анализа временных рядов
У меня есть месячные данные временных рядов, и я хотел бы сделать прогноз с обнаружением выбросов. Это образец моего набора данных: Jan Feb Mar Apr May Jun Jul Aug Sep Oct Nov Dec 2006 7.55 7.63 7.62 7.50 7.47 7.53 7.55 7.47 7.65 7.72 7.78 7.81 2007 7.71 7.67 7.85 …

2
Почему ρ Пирсона является лишь исчерпывающей мерой ассоциации, если совместное распределение является многомерным нормальным?
Это утверждение было высказано в ответе на этот вопрос . Я думаю, что вопрос «почему» достаточно отличается, что требует новой темы. Гугл "исчерпывающая мера ассоциации" не дал никаких результатов, и я не уверен, что означает эта фраза.

2
Зачем преобразовывать данные в журнал перед выполнением анализа главных компонентов?
Я следую учебному пособию здесь: http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/, чтобы лучше понять PCA. Учебное пособие использует набор данных Iris и применяет преобразование журнала до PCA: Обратите внимание, что в следующем коде мы применяем логарифмическое преобразование к непрерывным переменным, как предложено в [1], и устанавливаем centerи scaleравняемся TRUEпри вызове prcompдля стандартизации переменных до применения …

4
Непонимание P-значения?
Итак, я много читал о том, как правильно интерпретировать P-значение, и из того, что я прочитал, p-значение НИЧЕГО не говорит о вероятности того, что нулевая гипотеза верна или неверна. Однако при прочтении следующего утверждения: Значение p представляет вероятность допустить ошибку типа I или отклонить нулевую гипотезу, если она верна. Чем …

3
Зачем нам нужна самозагрузка?
В настоящее время я читаю «Все статистические данные» Ларри Вассермана и озадачен тем, что он написал в главе об оценке статистических функций непараметрических моделей. Он написал «Иногда мы можем найти оценочную стандартную ошибку статистической функции, выполнив некоторые вычисления. Однако в других случаях не очевидно, как оценить стандартную ошибку». Я хотел …

1
Интеграция Метрополис-Гастингс - почему не работает моя стратегия?
Предположим, у меня есть функция которую я хочу интегрировать Конечно, предполагая, что стремится к нулю в конечных точках, нет сбоев, хорошая функция. Один из способов , который я теребил является использование алгоритма Метрополиса-Гастингса , чтобы создать список образцов от распределения пропорционально к , который отсутствует константа нормировки который я назову …

3
ETS () функция, как избежать прогноза не в соответствии с историческими данными?
Я работаю над алгоритмом в R для автоматизации расчета ежемесячного прогноза. Я использую, среди прочего, функцию ets () из пакета прогноза для расчета прогноза. Это работает очень хорошо. К сожалению, для какого-то определенного временного ряда результат, который я получаю, странный. Пожалуйста, найдите ниже код, который я использую: train_ts<- ts(values, frequency=12) …

3
tanh против сигмовидной в нейронной сети
Я заранее прошу прощения за то, что до сих пор не тороплюсь с этим. Я пытаюсь понять плюсы и минусы использования tanh (карта от -1 до 1) против сигмовидной (карта от 0 до 1) для моей функции активации нейронов. Из моего чтения это звучало как незначительная вещь с незначительными различиями. …

1
Являются ли компоненты PCA многомерных гауссовских данных статистически независимыми?
Являются ли компоненты PCA (в анализе главных компонентов) статистически независимыми, если наши данные многомерны и нормально распределены? Если да, то как это можно продемонстрировать / доказать? Я спрашиваю, потому что я видел этот пост , где верхний ответ гласит: PCA не делает явного предположения гауссовости. Он находит собственные векторы, которые …
16 pca  independence  svd 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.