Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Каковы опасности нарушения предположения о гомоскедастичности для линейной регрессии?
В качестве примера рассмотрим ChickWeightнабор данных в R. Разница, очевидно, со временем увеличивается, поэтому, если я использую простую линейную регрессию, например: m <- lm(weight ~ Time*Diet, data=ChickWeight) Мои вопросы: Какие аспекты модели будут сомнительными? Проблемы ограничены экстраполяцией вне Timeдиапазона? Насколько толерантна линейная регрессия к нарушению этого предположения (т. Е. Насколько …

3
В повышении, почему ученики «слабые»?
Смотрите также похожий вопрос на stats.SE . В таких алгоритмах повышения , как AdaBoost и LPBoost, известно, что «слабые» ученики, которых нужно объединить, должны работать лучше, чем шанс быть полезными, из Википедии: Используемые им классификаторы могут быть слабыми (т. Е. Отображать значительную частоту ошибок), но до тех пор, пока их …

4
Меры сходства или расстояния между двумя ковариационными матрицами
Существуют ли меры сходства или расстояния между двумя симметричными ковариационными матрицами (обе имеют одинаковые размеры)? Я имею в виду аналоги KL-расходимости двух вероятностных распределений или евклидова расстояния между векторами, за исключением примененных к матрицам. Я предполагаю, что было бы довольно много измерений подобия. В идеале я также хотел бы проверить …

1
Что стоит за Google Prediction API?
Google Prediction API - это облачный сервис, в котором пользователь может отправить некоторые обучающие данные для обучения таинственному классификатору, а затем попросить его классифицировать входящие данные, например, для реализации спам-фильтров или прогнозирования пользовательских предпочтений. Но что за кадром?

3
Каковы некоторые иллюстративные применения эмпирической вероятности?
Я слышал об эмпирической вероятности Оуэна, но до недавнего времени не обращал на это внимания, пока не наткнулся на интересную статью ( Mengersen et al. 2012 ). В моих попытках понять это я выяснил, что вероятность наблюдаемых данных представляется в виде L = ∏япя= ∏яп( Xя= х ) = ∏яп( …

4
Псевдо R квадрат формулы для GLM
Я нашел формулу для псевдо в книге Расширение линейной модели с помощью R, Джулиан Дж. Фарауэй (стр. 59).R2R2R^2 1−ResidualDevianceNullDeviance1−ResidualDevianceNullDeviance1-\frac{\text{ResidualDeviance}}{\text{NullDeviance}} . Это общая формула для псевдо R2R2R^2 для GLM?

1
Вычисление повторяемости эффектов по модели Лмера
Я только что наткнулся на эту статью , в которой описывается, как вычислить повторяемость (или надежность, или внутриклассовую корреляцию) измерения с помощью моделирования смешанных эффектов. Код R будет: #fit the model fit = lmer(dv~(1|unit),data=my_data) #obtain the variance estimates vc = VarCorr(fit) residual_var = attr(vc,'sc')^2 intercept_var = attr(vc$id,'stddev')[1]^2 #compute the unadjusted …
28 mixed-model  reliability  intraclass-correlation  repeatability  spss  factor-analysis  survey  modeling  cross-validation  error  curve-fitting  mediation  correlation  clustering  sampling  machine-learning  probability  classification  metric  r  project-management  optimization  svm  python  dataset  quality-control  checking  clustering  distributions  anova  factor-analysis  exponential  poisson-distribution  generalized-linear-model  deviance  machine-learning  k-nearest-neighbour  r  hypothesis-testing  t-test  r  variance  levenes-test  bayesian  software  bayesian-network  regression  repeated-measures  least-squares  change-scores  variance  chi-squared  variance  nonlinear-regression  regression-coefficients  multiple-comparisons  p-value  r  statistical-significance  excel  sampling  sample  r  distributions  interpretation  goodness-of-fit  normality-assumption  probability  self-study  distributions  references  theory  time-series  clustering  econometrics  binomial  hypothesis-testing  variance  t-test  paired-comparisons  statistical-significance  ab-test  r  references  hypothesis-testing  t-test  normality-assumption  wilcoxon-mann-whitney  central-limit-theorem  t-test  data-visualization  interactive-visualization  goodness-of-fit 


6
Какие интересные и хорошо написанные прикладные статистические работы?
Какие хорошие статьи описывают приложения статистики, которые было бы интересно и информативно читать? Просто чтобы прояснить, я на самом деле не ищу статьи, описывающие новые статистические методы (например, статью о регрессии наименьшего угла), а скорее статьи, описывающие, как решать реальные проблемы. Например, одна статья, которая соответствует тому, что я ищу, …

5
Измерение «расстояния» между двумя многомерными распределениями
Я ищу хорошую терминологию для описания того, что я пытаюсь сделать, чтобы упростить поиск ресурсов. Итак, скажем, у меня есть две группы точек A и B, каждая из которых связана с двумя значениями, X и Y, и я хочу измерить «расстояние» между A и B - то есть, насколько вероятно, …


3
Кому следовать на github, чтобы узнать о передовом опыте в анализе данных?
Полезно изучить код анализа данных экспертов. Недавно я просматривал github, и многие люди делятся там кодом анализа данных. Это включает в себя несколько пакетов R (которые, конечно, доступны непосредственно из CRAN), а также несколько примеров воспроизводимых исследований, особенно с использованием R ( см. Этот список R на github ). Кто …

6
Проблемы с круговыми диаграммами
Похоже, что все чаще обсуждают круговые диаграммы. Основными аргументами против этого являются: Площадь воспринимается с меньшей силой, чем длина. Круговые диаграммы имеют очень низкое отношение данных к пикселям Тем не менее, я думаю, что они могут быть как-то полезны при изображении пропорций. Я согласен использовать таблицу в большинстве случаев, но …

7
Как генерировать числа на основе произвольного дискретного распределения?
Как генерировать числа на основе произвольного дискретного распределения? Например, у меня есть набор чисел, которые я хочу сгенерировать. Скажем, они помечены как 1-3 следующим образом. 1: 4%, 2: 50%, 3: 46% По сути, проценты - это вероятность того, что они появятся в выходных данных генератора случайных чисел. У меня есть …

3
Вычисление p-значения с помощью начальной загрузки с R
Я использую пакет «boot» для вычисления приблизительного 2-стороннего загрузочного p-значения, но результат слишком далек от p-значения при использовании t.test. Я не могу понять, что я сделал неправильно в моем коде R. Может кто-нибудь, пожалуйста, дайте мне подсказку для этого time = c(14,18,11,13,18,17,21,9,16,17,14,15, 12,12,14,13,6,18,14,16,10,7,15,10) group=c(rep(1:2, each=12)) sleep = data.frame(time, group) require(boot) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.