Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как получить таблицу ANOVA с устойчивыми стандартными ошибками?
Я запускаю объединенную регрессию OLS с использованием пакета plm в R. Хотя мой вопрос больше относится к базовой статистике, поэтому я постараюсь сначала опубликовать ее здесь;) Так как мои результаты регрессии дают гетероскедастические остатки, я хотел бы попробовать использовать устойчивые стандартные ошибки гетероскедастичности. В результате coeftest(mod, vcov.=vcovHC(mod, type="HC0"))я получаю таблицу, …

1
Прогнозирование со случайными эффектами в MGCV GAM
Я заинтересован в моделировании общего вылова рыбы с использованием gam в mgcv для моделирования простых случайных эффектов для отдельных судов (которые совершают многократные поездки во время промысла). У меня 98 предметов, поэтому я решил использовать гамму вместо гамма для моделирования случайных эффектов. Моя модель: modelGOM <- gam(TotalFish ~ factor(SetYear) + …

3
Означает ли сезонный временной ряд стационарный или нестационарный временной ряд
Если у меня есть временной ряд с сезонностью, автоматически ли это делает серию нестационарной? Моя интуиция (вероятно, выключена) состоит в том, что это не так. Сезонность означает, что ряд идет вверх и вниз вокруг постоянной величины ... что-то вроде синусоиды. Таким образом, по этой логике временной ряд с сезонностью является …

2
Что именно представляет собой метод Бокса-Дженкинса для процессов ARIMA?
На странице Википедии говорится, что Box-Jenkins - это метод подгонки модели ARIMA к временному ряду. Теперь, если я хочу приспособить модель ARIMA к временному ряду, я открою SAS, вызову proc ARIMA, предоставлю параметры а SAS даст мне коэффициенты AR и MA. Теперь я могу попробовать разные комбинации и SAS даст …

3
Каковы критерии и решения для нелинейности в статистических моделях?
Я надеюсь, что следующий общий вопрос имеет смысл. Пожалуйста, имейте в виду, что для целей данного конкретного вопроса меня не интересуют теоретические (предметная область) причины введения нелинейности. Поэтому я сформулирую полный вопрос следующим образом: Какова логическая структура ( критерии и, если возможно, процесс принятия решений ) для введения нелинейности в …

1
Внутренняя пространственная стационарность: разве это не применимо только для небольших лагов?
Из определения внутренней стационарности: E[Z(x)−Z(x−h)]=0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0 Это предположение используется, например, в обычном кригинге, вместо того, чтобы предполагать постоянное среднее значение по всему пространству, мы предполагаем, что среднее значение является постоянным локально. Если среднее значение является постоянным в окрестности, мы логически ожидаем, что разница между двумя измерениями, близкими друг к …
10 spatial 

2
Как визуализировать проценты по сравнению с количеством записей.
Я пытаюсь найти лучший способ визуализировать приведенную ниже таблицу и подчеркнуть эффективность лечения в сравнении с количеством пациентов, которые попробовали лечение. Вот ссылка на реальную страницу: http://curetogether.com/cluster-headaches/treatments/ Каков наилучший способ подчеркнуть эффективность, в то же время упрощая сравнение процедур и определение количества пациентов, оцениваемых каждым? Моя мысль состояла в том, …

1
Ошибки обработки данных уже «учтены» в статистическом анализе?
Хорошо, честное предупреждение - это философский вопрос, в котором нет цифр. Я много размышлял о том, как ошибки проникают в наборы данных с течением времени и как это следует обрабатывать аналитикам - или это вообще должно иметь значение? Для справки, я делаю анализ долгосрочного исследования, которое включает в себя множество …
10 dataset  error 

2
Почему ошибка измерения в зависимой переменной не влияет на результаты?
Когда есть ошибка измерения в независимой переменной, я понял, что результаты будут смещены против 0. Когда зависимая переменная измерена с ошибкой, они говорят, что это просто влияет на стандартные ошибки, но это не имеет большого смысла для меня, потому что мы оценка влияния не на исходную переменную а на некоторую …

3
glm в R - какое значение pvalue соответствует качеству подгонки всей модели?
Я бегу glms в R (обобщенные линейные модели). Я думал, что знаю значения pvalue - пока не увидел, что вызов сводки для glm не дает вам превосходящего pvalue представителя модели в целом - по крайней мере, не там, где это делают линейные модели. Мне интересно, если это дано как значение …

4
Почему бы не преобразовать в лог все переменные, которые не представляют основного интереса?
В книгах и дискуссиях часто утверждается, что при возникновении проблем (из которых есть несколько) с предиктором, log-transformimg это возможно. Теперь я понимаю, что это зависит от распределений, и нормальность в предикторах не является предположением о регрессии; но преобразование журнала делает данные более однородными, меньше подверженными выбросам и так далее. Я …

2
Лучший метод для создания диаграмм роста
Я должен создать диаграммы (аналогичные диаграммам роста) для детей в возрасте от 5 до 15 лет (только 5,6,7 и т. Д .; нет дробных значений, таких как 2,6 года) для переменной здоровья, которая является неотрицательной, непрерывной и диапазон 50-150 (только несколько значений за пределами этого диапазона). Я должен создать кривые …

1
Покажем, что если
В настоящее время застрял на этом, я знаю, что я, вероятно, должен использовать среднее отклонение биномиального распределения, но я не могу понять это.

1
Случайный лесной вероятностный прогноз против большинства голосов
Кажется, Scikit Learn использует вероятностный прогноз вместо большинства голосов за метод агрегации моделей без объяснения причин (1.9.2.1. Случайные леса). Есть четкое объяснение почему? Кроме того, есть ли хорошая статья или обзорная статья о различных методах агрегации моделей, которые можно использовать для рандомизации по лесам? Спасибо!

3
Анализ временных рядов и машинное обучение?
Просто общий вопрос. Если у вас есть данные временных рядов, когда лучше использовать методы временных рядов (иначе, ARCH, GARCH и т. Д.), А не методы машинного / статистического обучения (KNN, регрессия)? Если есть аналогичный вопрос, который существует на перекрестном утверждении, пожалуйста, укажите мне на него - посмотрел и не смог …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.