Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
vcovHC, vcovHAC, NeweyWest - какую функцию использовать?
Я пытаюсь обновить модель на основе lm (), чтобы получить правильные стандартные ошибки и тесты. Я действительно запутался, какую матрицу VC использовать. В sandwichпакет предложений vcovHC, vcovHACи NeweyWest. В то время как первый учитывает только гетероскедастичность, последние два учитывают как последовательную корреляцию, так и гетероскедастичность. Тем не менее, документация мало …

1
Фильтр Калмана против сглаживания сплайнов
Вопрос: Для каких данных целесообразно использовать моделирование пространства состояний и фильтрацию Калмана вместо сглаживания сплайнов и наоборот? Есть ли какие-то отношения эквивалентности между ними? Я пытаюсь получить общее представление о том, как эти методы сочетаются друг с другом. Я просмотрел новую гауссовскую оценку Джонстона : модели последовательности и мультиразрешения . …

1
Можем ли мы сравнить корреляции между группами, сравнивая наклоны регрессии?
В этом вопросе они спрашивают, как сравнить Pearson r для двух независимых групп (таких как мужчины против женщин). Ответ и комментарии предложены двумя способами: Используйте известную формулу Фишера, используя "z-transformation" of r; Используйте сравнение уклонов (коэффициенты регрессии). Последнее можно легко выполнить только с помощью насыщенной линейной модели: , где X …

3
Линейная регрессия с факторами в R
Я пытаюсь понять, как именно факторы работают в R. Допустим, я хочу запустить регрессию, используя некоторые примеры данных в R: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) Call: …

3
Как проверить гипотезу, что корреляция равна заданному значению, используя R?
Есть ли функция для проверки гипотезы, что корреляция двух векторов равна заданному числу, скажем, 0,75? Используя cor.test, я могу проверить cor = 0 и посмотреть, находится ли 0,75 внутри доверительного интервала. Но есть ли функция для вычисления значения p для cor = 0,75? x <- rnorm(10) y <- x+rnorm(10) cor.test(x, …
10 r  correlation 

2
Что такое «отклонение вывода» и как его можно использовать для повышения точности модели?
Кто-нибудь может объяснить подробно: Что означает отклонение вывода? Как это можно использовать для повышения точности моей модели? У меня есть идея отказаться от логического вывода в приложении к кредитной карте, но я пытаюсь использовать его для повышения точности моей модели.
10 logistic 


1
Как вы генерируете ROC-кривые для перекрестной проверки без участия?
При выполнении 5-кратной перекрестной проверки (например) обычно рассчитывают отдельную кривую ROC для каждой из 5-кратных и часто умножают среднюю кривую ROC на стандартное отклонение. девиация показано как толщина кривой. Тем не менее, для перекрестной проверки LOO, когда в каждом сгибе имеется только один тестовый набор данных, не представляется разумным вычислять …

4
Хорошая книга о теоретическом подходе к статистике
Когда 10 лет назад я проходил курсы теоретической статистики в качестве старшекурсника, мы использовали « Современную математическую статистику » Дудевича и Мишры. Теперь я возвращаюсь к книге, и мне напоминают, что некоторые примеры кода находятся в сборке для IBM 370. Хотя это странно, я не могу не чувствовать, что это …
10 references 

2
Использовать ли смещение в регрессии Пуассона при прогнозировании общих карьерных целей, забитых хоккеистами
У меня вопрос по поводу того, стоит ли использовать смещение. Предположим, очень простая модель, где вы хотите описать (общее) количество голов в хоккее. Таким образом, у вас есть цели, количество сыгранных игр и фиктивная переменная «нападающий», которая равна 1, если игрок является нападающим, и 0 в противном случае. Итак, какая …

2
Отклонение влево относительно симметричного распределения наблюдается
Это довольно сложно описать, но я постараюсь сделать мою проблему понятной. Итак, сначала вы должны знать, что я до сих пор делал очень простую линейную регрессию. Прежде чем я оценил коэффициент, я наблюдал распределение моего . Тяжело уклонено. После того, как я оценил модель, я был вполне уверен, что наблюдал …

1
Доверительный интервал для различия средств в регрессии
Предположим, у меня есть модель квадратичной регрессии с ошибками удовлетворяющими обычным предположениям (независимым, нормальным, независимым от значений ). Пусть - оценки наименьших квадратов.Y=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 У меня есть два новых значения и , и я заинтересован в получении …

2
Как я могу объяснить пространственную ковариацию в линейной модели?
Фон У меня есть данные полевого исследования, в котором есть четыре уровня обработки и шесть повторностей в каждом из двух блоков. (4x6x2 = 48 наблюдений) Блоки находятся примерно в 1 миле друг от друга, а внутри блоков есть сетка из 42, 2 х 4 м участков и дорожка шириной 1 …

1
Что означает гауссовская эффективность?
В случае надежных оценок, что означает гауссовская эффективность ? Например, имеет эффективность Гаусса 82% и точку пробоя 50%.QNQNQ_{_n} Ссылка: Rousseeuw PJ и Croux, C. (1993). «Альтернативы срединному абсолютному отклонению». J. American Statistical Assoc., 88, 1273-1283

2
Как суммировать и сравнивать нелинейные отношения?
У меня есть данные о процентном содержании органических веществ в озерных отложениях от 0 см (т. Е. Граница раздела осадок - вода) до 9 см для приблизительно 25 озер. В каждом озере было взято 2 керна из каждого места, поэтому у меня есть 2 повторяющихся показателя процентного содержания органического вещества …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.