Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Определение крупнейшего участника в группе
Я не знаю много о статистике, так что терпите меня. Допустим, у меня есть набор из 1000 рабочих. Я хочу выяснить, кто самый трудный работник, но я могу измерить только объем работы, выполняемой группами по 1-100 человек за час работы. Предполагая, что каждый работник всегда выполняет примерно одинаковый объем работы, …

2
Вычисление проблем, интерпретация regsubsets и общие вопросы о процедуре выбора модели
Я хочу выбрать модели, используя regsubsets(). У меня есть фрейм данных с именем olympiadaten (загруженные данные: http://www.sendspace.com/file/8e27d0 ). Я сначала присоединяю этот фрейм данных, а затем начинаю анализировать, мой код: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + …

1
Доверительные и прогнозные интервалы линейной регрессионной модели
Итак, я пытаюсь понять линейную регрессию. У меня есть набор данных, и все выглядит хорошо, но я в замешательстве. Это моя линейная модель-сводка: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 …
9 r  regression 

3
Сравнение показателей заболеваемости
Я хочу сравнить показатели заболеваемости между двумя группами (одна без болезни и одна с). Я планировал рассчитать коэффициент заболеваемости (IRR), то есть группу заболеваемости B / группу заболеваемости A, а затем проверить, равен ли этот показатель 1, и, наконец, рассчитать 95% интервалы CI для IRR. Я нашел метод для расчета …

2
Использование параметра Gamma с машинами опорных векторов
При использовании libsvmпараметр является параметром для функции ядра. Его значение по умолчанию установлено какγγ\gammaγ= 1количество функций.γзнак равно1количество функций.\gamma = \frac{1}{\text{number of features.}} Существуют ли теоретические рекомендации по настройке этого параметра помимо существующих методов, например, поиск по сетке?

1
Распределение ошибок для линейной и логистической регрессии
При непрерывных данных линейная регрессия Y=β1+β2X2+uYзнак равноβ1+β2Икс2+UY=\beta_1+\beta_2X_2+u предполагает, что член ошибки распределен N (0, σ2σ2\sigma^2 ) 1) Предполагаем ли мы, что Var (Y | x) также ~ N (0, σ2σ2\sigma^2 )? 2) Что это за распределение ошибок в логистической регрессии? Когда данные представлены в виде 1 записи на случай, где …

1
Контроль уровня ложных открытий на стадиях
У меня есть трехмерная таблица размером . Каждая ячейка таблицы является проверкой гипотезы. Разрезание таблицы по третьему измерению дает набор тестов гипотез, которые не зависят от наборов, но зависят от наборов. Первоначально я думал, что смогу просто контролировать уровень ложных открытий, используя процедуру Бенджамини-Хохберга для всех тестов гипотез одновременно. Это …

4
Когда использовать непараметрическую регрессию?
Я использую PROC GLM в SAS, чтобы соответствовать уравнению регрессии следующего вида Y=b0+b1X1+b2X2+b3X3+b4tY=b0+b1X1+b2X2+b3X3+b4t Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t График QQ результирующих остатков указывает на отклонение от нормы. Любое преобразование бесполезно для нормализации остатков.YYY На этом этапе я могу безопасно переключиться на непараметрические методы, такие …

2
Почему величина дисперсии, описанная моим первым компьютером, так близка к средней попарной корреляции?
Какова связь между первым основным компонентом (ами) и средней корреляцией в матрице корреляции? Например, в эмпирическом приложении я наблюдаю, что средняя корреляция почти совпадает с отношением дисперсии первого главного компонента (первого собственного значения) к общей дисперсии (сумме всех собственных значений). Есть математические отношения? Ниже приведена таблица эмпирических результатов. Где корреляция …

3
Как использовать R gbm с distribution = «adaboost»?
Документация утверждает, что R gbm с distribution = "adaboost" может использоваться для задачи классификации 0-1. Рассмотрим следующий фрагмент кода: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Это можно найти в документации, которая прогнозирует.gbm Возвращает вектор прогнозов. …
9 r  gbm 

3
Случайное назначение: зачем?
Случайное назначение является ценным, поскольку оно обеспечивает независимость лечения от возможных результатов. Вот как это приводит к объективным оценкам среднего эффекта лечения. Но другие схемы назначения также могут систематически обеспечивать независимость лечения от возможных результатов. Так зачем нам случайное назначение? Другими словами, в чем преимущество случайного назначения по сравнению со …

1
Как сравнить наблюдаемые и ожидаемые события?
Предположим, у меня есть одна выборка частот из 4 возможных событий: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 и у меня есть ожидаемые вероятности того, что мои события произойдут: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 С суммой наблюдаемых частот …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

1
Параметризация распределений Беренса – Фишера
«О проблеме Беренса-Фишера: обзор» Сео-Хо Кима и Аллена С. Коэна Журнал образовательной и поведенческой статистики , том 23, номер 4, зима, 1998, стр. 356–377 Я смотрю на эту вещь, и она говорит: Фишер (1935, 1939) выбрал статистику [гдеti- обычнаяt-статистика дляодной выборкидляi=1,2], гдеθберется в первом квадрант иtanθ=s1/ √τ= δ- ( х¯2- …

3
Какую модель можно использовать, когда допущение о постоянной дисперсии нарушается?
Поскольку мы не можем соответствовать модели ARIMA, когда допущение о постоянной дисперсии нарушается, какую модель можно использовать для соответствия одномерным временным рядам?

1
«Поскольку
Короткий вопрос: почему это правда ?? Длинный вопрос: Очень просто, я пытаюсь выяснить, что оправдывает это первое уравнение. Автор книги, которую я читаю (контекст здесь, если вы хотите, но не обязательно), утверждает следующее: Из-за предположения о почти гауссовости мы можем написать: п0( ξ) = Aϕ ( ξ)е х р ( …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.