Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Случайный лес и усиление являются параметрическими или непараметрическими?
Прочитав отличное статистическое моделирование: две культуры (Breiman 2001) , мы можем использовать все различия между традиционными статистическими моделями (например, линейной регрессией) и алгоритмами машинного обучения (например, Bagging, Random Forest, Boosted trees ...). Брейман критикует модели данных (параметрические), потому что они основаны на предположении, что наблюдения генерируются известной формальной моделью, предписанной …

3
Связь между суммой гауссовых RV и гауссовой смеси
Я знаю, что сумма гауссианов является гауссовой. Итак, чем же отличается смесь гауссов? Я имею в виду, смесь гауссианов - это просто сумма гауссиан (где каждый гауссиан умножается на соответствующий коэффициент смешения), верно?

1
Что это значит, если медиана или средняя сумма больше, чем сумма аддендов?
Я анализирую распределение сетевых задержек. Среднее время загрузки (U) составляет 0,5 с. Среднее время загрузки (D) составляет 2 с. Тем не менее, среднее общее время (для каждой точки данных, T = U + D) составляет 4 с. Какие выводы можно сделать, зная, что медиана суммы намного больше, чем сумма медиан …

1
Вопрос, связанный с леммой Бореля-Кантелли
Замечания: Борель-Кантелли Лемма говорит, что ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 Потом, if∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty с помощью леммы Бореля-Кантелли Я хочу показать что в первую очередь, limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n) …

1
Смещенная оценка для регрессии, достигающая лучших результатов, чем объективная оценка в модели Error In Variables
Я работаю над некоторыми синтетическими данными для модели Error In Variable для некоторых исследований. В настоящее время у меня есть одна независимая переменная, и я предполагаю, что знаю дисперсию для истинного значения зависимой переменной. Таким образом, с помощью этой информации я могу получить объективную оценку для коэффициента зависимой переменной. Модель: …

1
Параметры против скрытых переменных
Я спрашивал об этом раньше и действительно пытался определить, что делает параметр модели, а что скрытой переменной. Итак, глядя на различные темы по этой теме на этом сайте, основное различие выглядит следующим образом: Скрытые переменные не наблюдаются, но имеют связанное с ними распределение вероятностей, так как они являются переменными, а …

1
Аддитивная ошибка или мультипликативная ошибка?
Я относительно новичок в статистике и был бы признателен за помощь в понимании этого вопроса. В моей области есть широко используемая модель вида: пT= Pо( VT)αпTзнак равнопо(ВT)αP_t = P_o(V_t)^\alpha Когда люди подгоняют модель к данным, они обычно линеаризуют ее и соответствуют следующим журнал( PT) = журнал( Pо) + α log( …

3
Почему след
В модели y=Xβ+ϵy=Xβ+ϵ{y} = X \beta + \epsilon мы могли бы оценить ββ\beta используя нормальное уравнение: β^=(X′X)−1X′y,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y,и мы могли бы получить у =X & beta .y^=Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. Вектор невязок оценивается как ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,\hat{\epsilon} = y - X \hat{\beta} = (I - X (X'X)^{-1} X') y = Q …


2
В чем разница между выбором объектов и уменьшением размерности?
Я знаю, что как выбор элементов, так и уменьшение размерности направлены на уменьшение количества элементов в исходном наборе элементов. Какая разница между ними, если мы делаем одно и то же в обоих?

2
Процедура и методы анализа временных рядов с использованием R
Я работаю над небольшим проектом, в котором мы пытаемся прогнозировать цены на товары (нефть, алюминий, олово и т. Д.) На ближайшие 6 месяцев. У меня есть 12 таких переменных для прогнозирования, и у меня есть данные за апрель 2008 года - май 2013 года. Как я должен идти о предсказании? …

3
Какой из них лучше максимальная вероятность или предельная вероятность и почему?
При выполнении регрессии, если мы перейдем к определению из: Какова разница между частичной вероятностью, профильной вероятностью и предельной вероятностью? что Максимальное правдоподобие Найти β и θ, который максимизирует L (β, θ | данных). В то время как предельное правдоподобие Мы интегрируем θ из уравнения правдоподобия, используя тот факт, что мы …

1
Является ли сообщество машинного обучения «обусловленным» и «параметризованным»?
Скажем, зависит от . Строго говоря,αXXXαα\alpha если и α обе случайные величины, мы могли бы написать p ( X ∣ α ) ;XXXαα\alphap(X∣α)p(X∣α)p(X\mid\alpha) однако, если - случайная величина, а α - параметр, мы должны написать p ( X ; α ) .XXXαα\alphap(X;α)p(X;α)p(X; \alpha) Я заметил несколько раз, что сообщество машинного …

1
Тест на коинтеграцию между двумя временными рядами с использованием двухэтапного метода Энгла – Грейнджера
Я пытаюсь проверить коинтеграцию между двумя временными рядами. Обе серии имеют еженедельные данные, охватывающие ~ 3 года. Я пытаюсь сделать двухэтапный метод Энгла-Грейнджера. Мой порядок действий следующий. Протестируйте каждый временной ряд для корневого модуля с помощью Augmented Dickey-Fuller. Предполагая, что оба имеют единичные корни, найдите линейную аппроксимацию отношения через OLS. …

4
Хорошая практика для статистического анализа в бизнес-среде
(Хотя я понимаю, что речь идет не только о статистике, но и о распространении статистики в бизнес-среде, поэтому я предположил, что она все еще находится в диапазоне тем резюме) Краткая предыстория: Наша бизнес-среда (и я подозреваю, что другие среды) имеют функцию поддержки, которая специализируется на статистическом анализе и исследованиях. Мы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.