Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Существует ли верхний предел количества интервалов в гистограмме?
Я прочитал несколько статей и выдержки из книг, которые объясняют, как выбрать хорошее количество интервалов (бинов) для гистограммы набора данных, но мне интересно, есть ли жесткое максимальное количество интервалов, основанное на количестве точек в набор данных или какой-то другой критерий. Справочная информация: причина, по которой я спрашиваю, состоит в том, …

2
REML против ML stepAIC
Я чувствую себя ошеломленным после того, как попытаюсь покопаться в литературе о том, как проводить анализ смешанной модели, следуя его примеру с использованием AIC, чтобы выбрать лучшую модель или модели. Я не думаю, что мои данные настолько сложны, но я ищу подтверждение того, что я сделал правильно, а затем советую, …

1
Интерпретация коэффициентов взаимодействия между категориальной и непрерывной переменной
У меня вопрос по поводу интерпретации коэффициентов взаимодействия между непрерывной и категориальной переменными. вот моя модель: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 -1.785 0.07469 . …

3
Winbugs и другие MCMC без информации для предварительного распространения
Что происходит, когда у вас нет представления о распределении параметров? Какой подход мы должны использовать? В большинстве случаев мы стремимся недооценивать, влияет ли определенная переменная на наличие / отсутствие определенного вида, и принимается или нет переменная в соответствии с важностью переменной. Это означает, что в большинстве случаев мы не думаем …
10 r  bayesian  mcmc  bugs  winbugs 

5
Можно ли сначала подгонять байесовскую модель, а затем начинать ослаблять приоры?
При выполнении частых статистических заданий существует длинный список больших запретов, например, просмотр результатов статистических тестов перед принятием решения о сборе дополнительных данных. В общем, мне интересно, есть ли подобный список исключений для методологий, используемых в байесовской статистике, и, в частности, является ли следующее одним из них. Недавно я понял, что …

2
GAM перекрестная проверка для проверки ошибки предсказания
Мои вопросы касаются GAMs в пакете mgcv R. Из-за небольшого размера выборки я хочу определить ошибку прогнозирования, используя перекрестную проверку с пропуском. Это разумно? Есть ли пакет или код, как я могу это сделать? errorest()Функция в ipred пакете не работает. Простой тестовый набор данных: library(mgcv) set.seed(0) dat <- gamSim(1,n=400,dist="normal",scale=2) b<-gam(y~s(x0)+s(x1)+s(x2)+s(x3),data=dat) …
10 r  cross-validation  gam  mgcv 

1
Расчет интервалов прогнозирования при использовании перекрестной проверки
Оценки стандартного отклонения рассчитываются по формуле: sN=1N∑Ni=1(xi−x¯¯¯)2−−−−−−−−−−−−−√.sN=1N∑i=1N(xi−x¯)2. s_N = \sqrt{\frac{1}{N} \sum_{i=1}^N (x_i - \overline{x})^2}. ( http://en.wikipedia.org/wiki/Standard_deviation#Sample_standard_deviation ) для точности прогноза, взятой из 10-кратной перекрестной проверки? Я обеспокоен тем, что точность прогноза, рассчитанная между каждым разом, зависит от существенного совпадения между тренировочными наборами (хотя наборы предсказаний независимы). Любые ресурсы, которые обсуждают …

1
Оптимальное количество компонентов в гауссовой смеси
Таким образом, получение «идеи» об оптимальном количестве кластеров в k-средних хорошо документировано. Я нашел статью о том, как сделать это в гауссовых смесях, но не уверен, что меня это убедило, я не очень хорошо понимаю. Есть ли ... более мягкий способ сделать это?

3
Как найти сходство между временными рядами?
В следующем примере у меня есть кадр данных, который состоит из временного ряда измерений температуры воды, зарегистрированных на 5 глубинах в океане, где каждое значение Tempсоответствует дате в DateTimeи глубине в Depth. set.seed(1) Temp <- rnorm(43800,sd=20) AirT <- rnorm(8760,sd=20) Depth <- c(1:5) DateTime = seq(from=as.POSIXct("2010-01-01 00:00"), to=as.POSIXct("2010-12-31 23:00"), length=8760) Time …

3
Возможный диапазон
Предположим, есть три временных ряда, Икс1X1X_1 , Икс2X2X_2 и YYY Запуск обычной линейной регрессии на YYY ~ Икс1X1X_1 ( Y= B X1+ б0+ ϵY=bX1+b0+ϵY = b X_1 + b_0 + \epsilon ), получаем р2= UR2=UR^2 = U . Обычная линейная регрессия YYY ~ Икс2X2X_2 Get р2= VR2=VR^2 = V . …

4
Дисперсия резисторов параллельно
Предположим, у вас есть набор резисторов R, все из которых имеют среднее значение μ и дисперсию σ. Рассмотрим часть схемы со следующим расположением: (r) || (r + r) || (г + г + г). Эквивалентное сопротивление каждой части составляет r, 2r и 3r. Тогда дисперсия каждого сечения будет σ2σ2σ^2 , …

2
Смысл 2.04 стандартных ошибок? Значительно разные средства, когда доверительные интервалы широко перекрываются?
Изображение ниже из этой статьи в психологической науке . Коллега указал на две необычные вещи об этом: Согласно подписи, столбцы ошибок показывают «± 2,04 стандартных ошибок, 95% доверительный интервал». Я только видел, как ± 1,96 SE использовался для 95% -ного КИ, и я не могу найти ничего о том, что …

1
Как получить прогноз для конкретной переменной в WinBUGS?
Я новый пользователь WinBUGS и у меня есть один вопрос для вашей помощи. После запуска следующего кода я получил параметры beta0сквозного beta4(статистика, плотность), но я не знаю, как получить прогноз последнего значения h, которое я установил NAдля моделирования в коде. Кто-нибудь может дать мне подсказку? Любой совет будет принята с …

2
Гауссовская регрессия процесса для наборов данных больших размеров
Просто хотел посмотреть, есть ли у кого-нибудь опыт применения Гауссовой регрессии процессов (GPR) к многомерным наборам данных. Я изучаю некоторые из различных методов разреженного георадара (например, разреженных псевдо-входов георадара), чтобы увидеть, что может работать для наборов данных большого размера, где в идеале выбор объектов является частью процесса выбора параметров. Любые …

1
Допустимо ли использовать две линейные модели на одном наборе данных?
Для линейной регрессии с несколькими группами (естественные группы определены априори) допустимо ли запускать две разные модели на одном наборе данных, чтобы ответить на следующие два вопроса? Есть ли в каждой группе ненулевой наклон и ненулевой перехват, и каковы параметры для каждой из них в рамках регрессии группы? Существует ли, независимо …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.