Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Почему случайные прогулки взаимосвязаны?
Я заметил, что в среднем абсолютное значение коэффициента корреляции Пирсона является константой, близкой к любой паре независимых случайных блужданий, независимо от длины блуждания.0.560.42 Может кто-нибудь объяснить это явление? Я ожидал, что корреляции уменьшатся с увеличением длины прогулки, как и в любой случайной последовательности. Для своих экспериментов я использовал случайные прогулки …

2
Является ли вариация такой же, как дисперсия?
Это мой первый вопрос о перекрестной проверке здесь, поэтому, пожалуйста, помогите мне, даже если это кажется тривиальным :-) Прежде всего, вопрос может быть результатом языковых различий или, возможно, у меня есть реальные недостатки в статистике. Тем не менее, вот оно: В статистике населения, вариации и дисперсии одни и те же …


17
Как описать статистику в одном предложении?
Когда я впервые начал изучать статистику, такие процедуры, как t-тест, ANOVA, хи-квадрат и линейная регрессия, казались совершенно разными существами. Но теперь я понимаю, что эти процедуры делают более или менее одно и то же. Кроме того, такие значения, как дисперсия, остатки, стандартная ошибка и среднее значение, также измеряют более или …
27 definition 

2
Какие значения p, d, q в ARIMA?
В arimaфункции в R, то , что делает order(1, 0, 12)среднее? Каковы ценности , которые могут быть назначены p, d, qи что этот процесс , чтобы найти эти значения?
27 r  time-series  arima 

4
Подводные камни в экспериментальном дизайне: избегание мертвых экспериментов
Я встречал эту цитату много раз: Чтобы проконсультироваться со статистиком после завершения эксперимента, часто достаточно просто попросить его провести посмертное обследование. Возможно, он может сказать, от чего умер эксперимент. - Рональд Фишер (1938) Мне кажется, это немного самонадеянно. Единственные примеры, которые я когда-либо нашел, описывающие, как эксперименты умирают без хорошего …

2
Как построить 95% доверительный интервал разницы между медианами?
Моя проблема: параллельное групповое рандомизированное исследование с очень искаженным распределением первичного результата. Я не хочу предполагать нормальность и использовать 95% ДИ, основанные на норме (то есть, используя 1,96 X SE). Мне удобно выражать меру центральной тенденции как медиану, но мой вопрос заключается в том, как построить 95% -е ДИ разницы …

7
Корреляция эквивалентна ассоциации?
Мой профессор статистики утверждает, что слово «корреляция» применяется строго к линейным отношениям между переменными, тогда как слово «ассоциация» широко применяется к любому типу отношений. Другими словами, он утверждает, что термин «нелинейная корреляция» является оксюмороном. Из того, что я могу сделать из этого раздела в статье в Википедии « Корреляция и …

5
Что может привести к тому, что PCA ухудшит результаты классификатора?
У меня есть классификатор, по которому я делаю перекрестную проверку, а также около сотни функций, по которым я делаю предварительный выбор, чтобы найти оптимальные комбинации функций. Я также сравниваю это с проведением тех же экспериментов с PCA, где я беру потенциальные особенности, применяю SVD, преобразую исходные сигналы в новое координатное …

3
Если линейная регрессия связана с корреляцией Пирсона, существуют ли какие-либо методы регрессии, связанные с корреляциями Кендалла и Спирмена?
Может быть, этот вопрос наивный, но: Если линейная регрессия тесно связана с коэффициентом корреляции Пирсона, существуют ли какие-либо методы регрессии, тесно связанные с коэффициентами корреляции Кендалла и Спирмена?

4
Минимальный размер выборки для PCA или FA, когда основной целью является оценка только нескольких компонентов?
Если у меня есть набор данных с наблюдениями и переменными (измерениями), и, как правило, мало ( ), и может варьироваться от маленького ( ) до, возможно, гораздо большего ( ).p n n = 12 - 16 p p = 4 - 10 p = 30 - 50nNnpppnnnn=12−16n=12−16n=12-16pppp=4−10p=4−10p = 4-10p=30−50p=30−50p= 30-50 …

3
Что вызывает разрыв в распределении опубликованных значений р при р <0,05?
В недавней работе Masicampo и Lalande (ML) собрали большое количество p-значений, опубликованных во многих различных исследованиях. Они наблюдали любопытный скачок в гистограмме значений p прямо на каноническом критическом уровне 5%. Есть хорошая дискуссия об этом явлении ML в блоге профессора Вассермана: http://normaldeviate.wordpress.com/2012/08/16/p-values-gone-wild-and-multiscale-madness/ В его блоге вы найдете гистограмму: Поскольку уровень …

2
В многоуровневой модели, каковы практические значения оценки параметров корреляции случайных эффектов, а не оценки?
В многоуровневой модели, каковы практические и связанные с интерпретацией последствия оценки, а не оценки параметров корреляции случайных эффектов? Практическая причина спрашивать это состоит в том, что в структуре Лмера в R нет реализованного метода для оценки p-значений с помощью методов MCMC, когда оценки делаются в модели корреляций между параметрами. Например, …

3
Лучший бандитский алгоритм?
Самым известным бандитским алгоритмом является верхний предел доверия (UCB), который популяризировал этот класс алгоритмов. С тех пор я предполагаю, что теперь есть лучшие алгоритмы. Каков текущий лучший алгоритм (с точки зрения либо эмпирической производительности, либо теоретических границ)? Является ли этот алгоритм оптимальным в некотором смысле?

4
Создание визуально привлекательных карт плотности плотности в R
Хотя я знаю, что существует ряд функций для генерации тепловых карт в R, проблема в том, что я не могу создавать визуально привлекательные карты. Например, изображения ниже являются хорошими примерами тепловых карт, которых я хочу избежать. В первом явно не хватает деталей, а в другом (основанном на тех же пунктах) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.