Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Как определить поляризованные мнения пользователей (высокие и низкие звездные рейтинги)
Если у меня есть система звездного рейтинга, где пользователи могут выразить свое предпочтение продукту или товару, как я могу определить статистически, если голоса сильно «разделены». Значение, даже если среднее значение составляет 3 из 5, для данного продукта, как я могу определить, является ли это 1-5 разделением против консенсуса 3, используя …

3
SVM для несбалансированных данных
Я хочу попытаться использовать машины опорных векторов (SVM) в моем наборе данных. Перед тем, как попытаться решить проблему, меня предупредили, что SVM плохо работают с крайне несбалансированными данными. В моем случае у меня может быть 95-98% 0 и 2-5% 1. Я пытался найти ресурсы, в которых говорилось об использовании SVM …

2
Расчет АПК «вручную» в R
Я попытался вычислить AIC линейной регрессии в R, но без использования AICфункции, например: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Тем не менее, AICдает другое значение: AIC(lm_mtcars) [1] 190.7999 Может кто-нибудь сказать мне, что я делаю не так?

4
Подводные камни, которых следует избегать при преобразовании данных?
Я добился прочной линейной взаимосвязи между моей переменной XXX и YYY после двукратного преобразования ответа. Модель была Y∼XY∼XY\sim X но я преобразовал ее в YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X} улучшилR2R2R^2с .19 до .76. Очевидно, я сделал приличную операцию на этих отношениях. Может ли кто-нибудь обсудить подводные камни, связанные с этим, такие как опасность …

3
Почему никто не использует байесовский полиномиальный наивный байесовский классификатор?
Таким образом, в (неконтролируемом) текстовом моделировании скрытое распределение Дирихле (LDA) является байесовской версией вероятностного скрытого семантического анализа (PLSA). По сути, LDA = PLSA + Dirichlet перед его параметрами. Насколько я понимаю, LDA теперь является эталонным алгоритмом и реализован в различных пакетах, в то время как PLSA больше не следует использовать. …

2
Являются ли распределения выборки законными для вывода?
Некоторые байесовцы нападают на частые выводы, утверждая, что «нет уникального распределения выборки», потому что это зависит от намерений исследователя (Kruschke, Aguinis, & Joo, 2012, p. 733). Например, скажем, исследователь начинает сбор данных, но его финансирование было неожиданно сокращено после 40 участников. Как бы здесь были определены распределения выборки (и последующие …


1
Как добиться строго позитивных прогнозов?
Я работаю над временным рядом, значения которого строго положительны . Работая с различными моделями, включая AR, MA, ARMA и т. Д., Я не мог найти простой способ добиться строго положительных прогнозов. Я использую R для выполнения своих прогнозов, и все, что я смог найти, это прогноз.hts {hts}, у которого есть …

1
Какова интуиция за сменными образцами при нулевой гипотезе?
Тесты перестановки (также называемые тестом рандомизации, тестом повторной рандомизации или точным тестом) очень полезны и оказываются полезными, когда предположение о нормальном распределении, требуемое, например, t-testне выполняется, и когда преобразование значений путем ранжирования непараметрическое тестирование, как, Mann-Whitney-U-testможет привести к потере большего количества информации. Тем не менее, одно и только одно предположение …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

2
Оценка ARIMA от руки
Я пытаюсь понять, как оцениваются параметры в моделировании ARIMA / Box Jenkins (BJ). К сожалению, ни одна из книг, с которыми я столкнулся, подробно не описывает процедуру оценки, такую ​​как процедура оценки правдоподобия. Я нашел сайт / учебный материал, который был очень полезным. Ниже приведено уравнение из источника, указанного выше. …

4
Как выполнить регрессию для ненормальных данных, которые остаются ненормальными при преобразовании?
У меня есть некоторые данные (158 случаев), которые были получены из ответа по шкале Лайкерта на 21 вопросник. Я действительно хочу / нужно провести регрессионный анализ, чтобы увидеть, какие пункты в анкете предсказывают реакцию на общий элемент (удовлетворенность). Ответы обычно не распределяются (в соответствии с тестами KS), и я преобразовал …

1
Почему Чи-квадрат используется при создании доверительного интервала для дисперсии?
Это очень простой вопрос. Почему мы используем распределение хи-квадрат? В чем смысл этого распределения? Почему это распределение используется для создания доверительного интервала для дисперсии? Каждое место, где я пытаюсь найти объяснение, просто представляет этот факт, объясняет, когда использовать ци, но не объясняет, почему использовать ци и почему оно выглядит так, …

1
Как понять формулу коэффициента корреляции?
Может ли кто-нибудь помочь мне понять формулу корреляции Пирсона? образец = среднее из продуктов стандартных оценок переменных X и Y .rrrXXXYYY Я вроде понимаю, почему им нужно стандартизировать и Y , но как понять продукты обоих z-баллов? XXXYYY Эта формула также называется «коэффициент корреляции продукта и момента», но каково обоснование …

3
Понимание теории d-разделения в причинных байесовских сетях
Я пытаюсь понять логику d-разделения в каузальных байесовских сетях. Я знаю, как работает алгоритм, но я не совсем понимаю, почему «поток информации» работает так, как указано в алгоритме. Например, на графике выше, давайте подумаем, что нам дан только X, и никакой другой переменной не наблюдалось. Затем по правилам d-разделения поток …

1
Интерпретация переменных трассировок LASSO
Я новичок в glmnetпакете, и я все еще не уверен, как интерпретировать результаты. Может ли кто-нибудь помочь мне прочитать следующий сюжет трассировки? График был получен путем запуска следующего: library(glmnet) return <- matrix(ret.ff.zoo[which(index(ret.ff.zoo)==beta.df$date[2]), ]) data <- matrix(unlist(beta.df[which(beta.df$date==beta.df$date[2]), ][ ,-1]), ncol=num.factors) model <- cv.glmnet(data, return, standardize=TRUE) op <- par(mfrow=c(1, 2)) plot(model$glmnet.fit, "norm", …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.