Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Какая модель глубокого обучения может классифицировать категории, которые не являются взаимоисключающими
Примеры: у меня есть предложение в должностной инструкции: «Старший инженер Java в Великобритании». Я хочу использовать модель глубокого обучения, чтобы предсказать ее как 2 категории: English и IT jobs. Если я использую традиционную классификационную модель, она может предсказать только 1 метку с softmaxфункцией на последнем слое. Таким образом, я могу …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

3
Определение статистической значимости коэффициента линейной регрессии при наличии мультиколлинеарности
Предположим, у меня есть несколько городов с разной численностью населения, и я хотел узнать, существует ли положительная линейная зависимость между количеством винных магазинов в городе и количеством DUI. Где я определяю, является ли эта связь значимой или нет, основываясь на t-критерии предполагаемого коэффициента регрессии. Теперь четко поп. размер города будет …

4
Как определить, существенно ли отличаются две корреляции?
Я хочу определить, какой из двух наборов данных (B1, B2) лучше соотносит (Pearsons r) с другим набором (A). Во всех наборах данных отсутствуют данные. Как я могу определить, существенно ли отличается результирующая корреляция или нет? Например, значения 8426 присутствуют как в A, так и в B1, r = 0,74. 8798 …

2
Разброс отклонения: термин для ожидаемой квадратической ошибки прогноза за вычетом неснижаемой ошибки
Hastie et al. «Элементы статистического обучения» (2009) рассматривают процесс генерирования данных с E ( ε ) = 0 и Var ( ε ) = σ 2 ε .Y= ф( Х) + εY=f(X)+ε Y = f(X) + \varepsilon E(ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var(ε)=σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} Они представляют следующее разностное разложение ожидаемой квадратной ошибки прогноза в точке (стр. …

1
Становится ли Наивный Байес более популярным? Почему?
Это результат Google трендов, полученный для фразы «Наивный Байес» с января 2004 года по апрель 2017 года ( ссылка ). Согласно этой цифре, коэффициент поиска «Наивный байесовский» в апреле 2017 года примерно на 25% выше максимума за весь период времени. Означает ли это, что этот простой и старый метод получает …

6
Использование p-значения для вычисления вероятности того, что гипотеза верна; что еще нужно?
Вопрос: Одно из распространенных заблуждений относительно р-значений заключается в том, что они представляют вероятность того, что нулевая гипотеза верна. Я знаю, что это не правильно, и я знаю, что p-значения представляют только вероятность найти образец столь же экстремальный, как этот, учитывая, что нулевая гипотеза верна. Однако, интуитивно, нужно уметь вывести …

1
Каково практическое значение альфы в GLM с гамма-семейством?
Я подгоняю несколько моделей формы .. glm(DV ~ I(1/IV), family = Gamma(link = "log") .. и ищу способы сравнить модели, полученные для разных переменных. Мне интересно, имеет ли значение альфа какое-либо практическое применение? Для трех графиков ниже значения альфа 17,85, 9,03 и 6,27. Содержат ли эти значения какую-либо информацию, которая …

4
Как мне интерпретировать кривую выживания модели риска Кокса?
Как вы интерпретируете кривую выживания из модели пропорционального риска Кокса? В этом игрушечном примере предположим, что у нас есть модель пропорционального риска Кокса для ageпеременной в kidneyданных, и сгенерируем кривую выживания. library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() Например, в момент , какое утверждение верно? или оба не …

1
Как могут быть возможны проценты, не суммирующие до ста?
Я читал эту статью об аквапонике, и некоторые статистические данные не имели никакого смысла в отношении перечисленных процентов. Какой метод позволит этим процентам существовать? Наиболее часто растущими водными животными в процентах были тилапия (69%), декоративные рыбы (43%), сом (25%), другие водные животные (18%), окунь (16%), голубая жабра (15%), форель ( …

1
Нормально распределенные ошибки и центральная предельная теорема
Во Вводной эконометрике Вулдриджа есть цитата: Аргумент, оправдывающий нормальное распределение ошибок, обычно выполняется примерно так: поскольку является суммой многих ненаблюдаемых факторов, влияющих на , мы можем вызвать центральную предельную теорему, чтобы заключить, что имеет приблизительное нормальное распределение.uuuyyyuuu Эта цитата относится к одному из предположений линейной модели, а именно: u∼N(μ,σ2)u∼N(μ,σ2)u \sim …

3
PCA слишком медленный, когда оба n, p большие: альтернативы?
Настройка проблемы У меня есть данные (изображения) высокой размерности (4096), которые я пытаюсь визуализировать в 2D. С этой целью я использую t-sne способом, подобным следующему примеру кода Karpathy . Документация Scikit-Learn рекомендует использовать PCA, чтобы сначала уменьшить размерность данных: Настоятельно рекомендуется использовать другой метод уменьшения размерности (например, PCA для плотных …


2
Статистический вывод при неправильной спецификации модели
У меня есть общий методологический вопрос. Возможно, ответили раньше, но я не могу найти соответствующую ветку. Я буду признателен за указатели на возможные дубликаты. ( Вот превосходный, но без ответа. Это также похоже по духу, даже с ответом, но последний слишком конкретен с моей точки зрения. Это также близко, обнаружено …

1
Вероятность независимого пуассоновского процесса, обгоняющего другого
Я задавал этот вопрос раньше другим способом на других биржах стека, так что извините за некоторый репост. Я спрашивал своего профессора и пару аспирантов без какого-либо однозначного ответа. Сначала я сообщу о проблеме, затем о моем потенциальном решении и о проблеме с моим решением, извините за стену текста. Проблема: Предположим, …

1
Как я могу выделить шумные участки во временном ряду?
У меня есть много данных временных рядов - уровни воды и скорости против времени. Это результат моделирования гидравлической модели. В качестве части процесса проверки, чтобы подтвердить, что модель работает должным образом, я должен построить каждый временной ряд, чтобы убедиться, что в данных нет «колебаний» (см. Пример незначительного колебания ниже). Использование …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.