Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Когда использовать распределение Стьюдента или Нормального в линейной регрессии?
Я смотрю на некоторые проблемы, а в некоторых, чтобы проверить коэффициенты, иногда я вижу людей, использующих распределение Стьюдента, а иногда я вижу Нормальное распределение. Какое правило?

3
Порог для коэффициента корреляции, чтобы указать статистическую значимость корреляции в матрице корреляции
Я вычислил корреляционную матрицу набора данных, который содержит 455 точек данных, каждая точка данных содержит 14 характеристик. Таким образом, размерность корреляционной матрицы составляет 14 х 14. Мне было интересно, есть ли порог для значения коэффициента корреляции, который указывает, что существует значительная корреляция между двумя из этих характеристик. У меня есть …

6
Сравните R-квадрат из двух разных моделей Random Forest
Я использую пакет randomForest в R для разработки модели случайного леса, чтобы попытаться объяснить непрерывный результат в «широком» наборе данных с большим количеством предикторов, чем выборок. В частности, я подгоняю одну модель RF, позволяющую процедуре выбрать из набора ~ 75 переменных предиктора, которые я считаю важными. Я проверяю, насколько хорошо …

3
Вероятность события, которое не поддается измерению
Из теории меры мы знаем, что есть события, которые нельзя измерить, т. Е. Они не измеримы по Лебегу. Что мы называем событием с вероятностью, на которой мера вероятности не определена? Какие типы заявлений мы бы сделали о таком событии?

3
Объединение двух временных рядов путем усреднения точек данных
Я хотел бы объединить прогнозируемые и обратные (то есть прогнозируемые прошлые значения) данных временного ряда в один временной ряд, сводя к минимуму среднеквадратичную ошибку прогноза. Скажем, у меня есть временные ряды 2001–2010 годов с разрывом на 2007 год. Я смог прогнозировать 2007 год с использованием данных за 2001–2007 годы (красная …

1
Существует ли концепция «достаточных» данных для обучения статистическим моделям?
Я работаю над большим количеством статистических моделей, таких как скрытые марковские модели и модели гауссовой смеси. Я вижу, что для обучения хороших моделей в каждом из этих случаев требуется большой (> 20000 предложений для НММ) объем данных, который берется из аналогичных сред в качестве конечного использования. Мой вопрос: Существует ли …

5
Визуализация 2-буквенных комбинаций
Ответы на этот вопрос по SO вернули набор из примерно 125 одно- или двухбуквенных имен: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r-объекты [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" "D" "dc" "dd" …

1
Как превратить функцию в плотность вероятности, сохраняя при этом форму функции?
У меня есть ряд функций, каждая из которых, предположительно, представляет плотность случайной величины по агентам. Каждая функция также имеет домен, который описывает, какие значения случайной величины являются действительными. Теперь, если я правильно помню свои классы статистики, если я возьму интеграл одной из функций по значениям, описанным областью функции, я должен …

2
Существует ли статистика соответствия модели (например, AIC или BIC), которую можно использовать для абсолютных, а не просто относительных сравнений?
Я не очень знаком с этой литературой, поэтому, пожалуйста, прости меня, если это очевидный вопрос. Поскольку AIC и BIC зависят от максимизации вероятности, кажется, что они могут использоваться только для сравнительных сравнений между набором моделей, пытающихся соответствовать заданному набору данных. Насколько я понимаю, не имеет смысла вычислять AIC для модели …

2
Условия сходимости М-оценки к истинному среднему
Приведенные примеры из гауссовского распределения и M-оценки, , какие свойства на достаточны, чтобы гарантировать в вероятности? Является ли строго выпуклым и достаточно увеличивающимся?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow \muρρ\rho
10 estimation 

4
Онлайн обнаружение выбросов
Я хочу обрабатывать автоматически сегментированные изображения микроскопии для обнаружения неисправных изображений и / или ошибочных сегментаций как части высокопроизводительного конвейера обработки изображений. Существует множество параметров, которые можно вычислить для каждого необработанного изображения и сегментации, и которые становятся «экстремальными», когда изображение имеет дефект. Например, пузырь на изображении приведет к аномалиям, таким …
10 outliers  online 

1
Разрешено ли включать время в качестве предиктора в смешанных моделях?
Я всегда считал, что время не должно использоваться в качестве предиктора в регрессиях (в том числе в игре), потому что тогда просто «описать» саму тенденцию. Если цель исследования состоит в том, чтобы найти такие параметры окружающей среды, как температура и т. Д., Которые объясняют разницу, скажем, в активности животного, то …

2
Сравнение наборов временных рядов
У меня есть три набора данных временных рядов, которые я хочу сравнить. Они были взяты на 3 отдельных периода около 12 дней. Они представляют собой среднее, максимальное и минимальное количество голов, взятых в библиотеке колледжа в течение финальных недель. Мне пришлось сделать среднее, максимальное и минимальное, потому что почасовые подсчеты …

2
Есть ли у Андерсона дорогая проверка пригодности для двух наборов данных?
Я знаю, что ad.test () можно использовать для проверки нормальности. Можно ли получить ad.test для сравнения распределений из двух образцов данных? x <- rnorm(1000) y <- rgev(2000) ad.test(x,y) Как я могу выполнить тест Андерсона-Дарлинга на 2 образцах?

4
Почему демографы дают ставки на 100 000 человек?
Кажется универсальным, что демографическая статистика приводится в расчете на 100 000 населения в год. Например, число самоубийств, число убийств, год жизни с поправкой на инвалидность, этот список можно продолжить. Почему? Если бы мы говорили о химии, частями на миллион (ppm) является обычным явлением. Почему акт подсчета людей смотрелся принципиально иначе. …
10 demography  units 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.