Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Каковы преимущества / недостатки использования сплайнов, сглаженных сплайнов и эмуляторов гауссовских процессов?
Я заинтересован в изучении (и реализации) альтернативы полиномиальной интерполяции. Однако мне трудно найти хорошее описание того, как эти методы работают, как они связаны и как они сравниваются. Буду признателен за ваш вклад в плюсы / минусы / условия, при которых эти методы или альтернативы будут полезны, но некоторых хороших ссылок …

6
Хороший ресурс, чтобы понять ANOVA и ANCOVA?
Я провожу эксперименты для газеты и ищу интересную книгу / сайт, чтобы правильно понять, как работают ANOVA и ANCOVA. У меня хорошее математическое образование, поэтому мне не обязательно вульгарное объяснение. Я также хотел бы знать, как определить, когда использовать ANOVA вместо ANCOVA.

3
Как объединить доверительные интервалы для дисперсионного компонента модели смешанных эффектов при использовании множественного вменения
Логика множественного вменения (МИ) состоит в том, чтобы вменять пропущенные значения не один раз, а несколько (обычно М = 5) раз, что приводит к М завершенным наборам данных. Затем M завершенных наборов данных анализируются с использованием методов полных данных, на которых M оценок и их стандартные ошибки объединяются с использованием …

3
Применять «трюк с ядром» к линейным методам?
Трюк ядра используется в нескольких моделях машинного обучения (например , SVM ). Впервые он был представлен в статье «Теоретические основы метода потенциальных функций в обучении распознаванию образов» в 1964 году. Определение Википедии говорит, что это способ использования алгоритма линейного классификатора для решения нелинейной задачи путем отображения исходных нелинейных наблюдений в …

14
Программное обеспечение для простого, но надежного исследования данных
В моих попытках бороться с хаосом электронных таблиц я часто проповедую более надежные инструменты, такие как программное обеспечение для реальной статистики (R, Stata и т. П.). Недавно меня оспорил этот взгляд, который заявил, что просто не научится программировать. Я хотел бы предоставить им инструменты анализа данных, которые не требуют программирования …

2
Корректировка ковариат в анализе кривой ROC
Этот вопрос касается оценки пороговых значений в многомерном скрининговом вопроснике для прогнозирования двоичной конечной точки при наличии коррелированных шкал. Меня спросили об интересе к контролю за ассоциированными подсчетами при разработке предельных баллов по каждому измерению шкалы измерений (личностных черт), которые могут использоваться для скрининга на алкоголизм. То есть, в данном …
20 epidemiology  roc 

4
Алгоритмы Метрополис-Гастингс, используемые на практике
Сегодня я читал блог Кристиана Роберта, и мне очень понравился новый алгоритм Метрополиса-Гастингса, который он обсуждал. Это казалось простым и легким в реализации. Всякий раз, когда я кодирую MCMC, я склонен придерживаться очень простых алгоритмов MH, таких как независимые движения или случайные обходы в логарифмическом масштабе. Какие алгоритмы MH люди …

2
Как случайный лес генерирует случайный лес
Я не эксперт по случайным лесам, но я четко понимаю, что ключевая проблема со случайным лесом - это (случайное) генерирование деревьев. Можете ли вы объяснить мне, как создаются деревья? (т.е. что такое используемый дистрибутив для генерации дерева?) Заранее спасибо !

6
Мой метеоролог точен?
Вопрос, который беспокоил меня некоторое время, и я не знаю, как его решить: Каждый день мой метеоролог дает процентную вероятность дождя (предположим, что она рассчитана на 9000 цифр, и он никогда не повторял число). Каждый последующий день идет дождь или не идет дождь. У меня есть годы данных - вероятность …

4
Каковы правильные значения для точности и отзыва в крайних случаях?
Точность определяется как: p = true positives / (true positives + false positives) Является ли это исправить , что, как true positivesи false positivesподход 0, точность приближается к 1? Тот же вопрос для отзыва: r = true positives / (true positives + false negatives) В настоящее время я выполняю статистический …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 

4
Какова жесткая нижняя граница времени сбора купонов?
В классической задаче по сбору купонов хорошо известно, что время необходимое для завершения набора из случайно выбранных купонов, удовлетворяет , и .TТTnNnE[T]∼nlnnE[T]∼nln⁡nE[T] \sim n \ln n Var(T)∼n2Var(T)∼n2Var(T) \sim n^2Pr(T&gt;nlnn+cn)&lt;e−cPr(T&gt;nln⁡n+cn)&lt;e−c\Pr(T > n \ln n + cn) < e^{-c} Эта верхняя граница лучше, чем та, которую дает неравенство Чебышева, которое было бы …

5
Пост-хоккей в рамках предметных тестов?
Какой метод является предпочтительным для проведения специальных тестов для внутрисубъектных тестов? Я видел опубликованную работу, где используется HSD Тьюки, но обзор Keppel и Maxwell &amp; Delaney предполагает, что вероятное нарушение сферичности в этих конструкциях делает ошибочный термин ошибочным, и этот подход проблематичным. Maxwell &amp; Delaney предлагают подход к проблеме в …

5
Когда вы можете использовать критерии на основе данных для определения регрессионной модели?
Я слышал, что когда многие спецификации регрессионных моделей (скажем, в OLS) рассматриваются как возможности для набора данных, это вызывает многочисленные проблемы сравнения, а значения p и доверительные интервалы перестают быть надежными. Одним из крайних примеров этого является ступенчатая регрессия. Когда я могу использовать сами данные, чтобы помочь определить модель, и …

4
Модель соответствует данным или данные соответствуют модели?
Существует ли концептуальная или процедурная разница между подгонкой модели к данным и подгонкой данных к модели? Пример первой формулировки можно увидеть в https://courses.washington.edu/matlab1/ModelFitting.html , а второй - в https://reference.wolfram.com/applications/eda/FittingDataToLinearModelsByLeast-SquaresTechniques.html. ,

2
Почему минимизация MAE приводит к прогнозированию медианы, а не среднего значения?
Из учебника « Прогнозирование: принципы и практика » Роба Хиндмана и Джорджа Афанасопулоса , в частности, раздел об измерении точности : Прогнозный метод, который минимизирует MAE, приведет к прогнозам медианы, а минимизация RMSE приведет к прогнозам среднего значения. Может ли кто-то дать интуитивное объяснение того, почему минимизация MAE приводит к …
20 forecasting  mean  median  rms  mae 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.