Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Оценка значимости корреляции
У меня есть две переменные, и я могу рассчитать, например, корреляцию Пирсона между ними, но я хотел бы знать что-то аналогичное тому, что даст мне t-критерий (т.е. некоторое представление о том, насколько значима корреляция). Существует ли такая вещь?

1
Каковы практические и интерпретационные различия между альтернативами и логистической регрессией?
Недавний вопрос об альтернативах логистической регрессии в R дал множество ответов, включая randomForest, gbm, rpart, bayesglm и обобщенные аддитивные модели. Каковы практические и интерпретационные различия между этими методами и логистической регрессией? Какие предположения они делают (или не делают) относительно логистической регрессии? Подходят ли для проверки гипотез? И т.п.

2
Оцените систему оценок, чтобы отдавать предпочтение предметам, оцененным большим количеством людей, по сравнению с предметами, оцененными меньшим количеством людей?
Заранее спасибо за терпение, я не статистик и не знаю, как описать то, что я представляю, поэтому Google не помогает мне здесь ... Я включил систему рейтинга в веб-приложение, над которым я работаю. Каждый пользователь может оценить каждый элемент ровно один раз. Я представлял себе шкалу с 4 значениями: «сильно …
9 scales  rating 

2
R: обновить график динамически [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 8 месяцев назад . Это вопрос визуализации данных. У меня есть база данных, которая содержит некоторые данные, которые постоянно пересматриваются (онлайн-обновление). Как лучше …

1
Должен ли я перетасовать свои данные?
У нас есть набор биологических образцов, которые было довольно дорого получить. Мы провели эти выборки с помощью серии тестов, чтобы сгенерировать данные, которые используются для построения прогнозной модели. Для этого мы разделили образцы на тренировочный (70%) и испытательный (30%) наборы. Мы успешно создали модель и применили ее на испытательном стенде, …

1
Регрессия наименьшего угла сохраняет корреляции монотонно убывающими и связанными?
Я пытаюсь решить проблему для наименьшего угла регрессии (LAR). Это проблема 3,23 на странице 97 из Гесте и др., Элементы статистического обучения, второй. редактор (5-я печать) . Рассмотрим регрессионную проблему со всеми переменными и ответом, имеющими среднее значение ноль и стандартное отклонение единицу. Предположим также, что каждая переменная имеет одинаковую …

1
Размер выборки для пропорций в повторных измерениях
Я пытаюсь помочь ученому разработать исследование для выявления микробов сальмонеллы. Он хотел бы сравнить экспериментальную антимикробную композицию с хлором (отбеливателем) на птицефабриках. Поскольку фоновые показатели содержания сальмонеллы различаются с течением времени, он планирует измерить% птицы с сальмонеллой до и после лечения. Таким образом, измерением будет разница до / после% сальмонеллы …

2
Принуждение набора чисел к гауссовой кривой
( Это относится к моему вопросу программирования о переполнении стека : гауссовский алгоритм кривой Белла (Python и / или C #) .) На Answers.com я нашел этот простой пример: Найти среднее арифметическое (среднее) => Сумма всех значений в наборе, деленная на количество элементов в наборе Найти сумму квадратов всех значений …

2
Инкрементальное обучение для модели временных рядов LOESS
В настоящее время я работаю с данными временных рядов, я знаю, что могу использовать модель LOESS / ARIMA. Данные записываются в вектор, длина которого равна 1000, что является очередью, обновляемой каждые 15 минут, Таким образом, старые данные будут появляться, а новые - в векторе. Я могу перезапустить всю модель в …

4
Каковы предположения для применения регрессионной модели Тобита?
Мои (очень базовые) знания о модели регрессии Тобита не из класса, как я бы предпочел. Вместо этого я собрал фрагменты информации здесь и там через несколько поисков в Интернете. Мое лучшее предположение в отношении усеченной регрессии состоит в том, что они очень похожи на предположения обычных наименьших квадратов (OLS). Я …

3
Как повторно сэмплировать временной ряд XTS в R?
У меня нерегулярно разнесенный XTSвременной ряд (со POSIXctзначениями в качестве типа индекса). Как я могу построить новый временной ряд, выбранный, скажем, с 10-минутным интервалом, но с каждым моментом выборки, выровненным по времени раунда (13:00:00, 13:10:00, 13:20:00, ...) , Если момент пересэмплирования не попадает точно в исходное значение серии, я хочу …

2
Отбор проб из двумерного распределения с известной плотностью с использованием MCMC
Я попытался смоделировать из двумерной плотности используя алгоритмы Метрополиса в R, и мне не повезло. Плотность может быть выражена как , где - распределение Сингх-Маддалар ( х , у)п(Икс,Y)p(x,y)р ( у| х)р(х)п(Y|Икс)п(Икс)p(y|x)p(x)р ( х )п(Икс)p(x) p ( x ) = a qИкса - 1бa( 1 + ( хб)a)1 + qп(Икс)знак …

2
Как проверить, равны ли наклоны в линейной модели фиксированному значению?
Предположим, у нас есть простая модель линейной регрессии и мы хотим проверить нулевую гипотезу против общей альтернативы.H 0 : a = b = 1Z= Х+ б YZ=aX+bYZ = aX + bYЧАС0: a = b = 12H0:a=b=12H_0: a=b=\frac{1}{2} Я думаю, что можно использовать оценку и и дополнительно применить тест, чтобы получить …

2
Рассчитать кривую ROC для данных
Итак, у меня есть 16 испытаний, в которых я пытаюсь идентифицировать человека по биометрической характеристике, используя расстояние Хэмминга. Мой порог установлен на 3,5. Мои данные ниже, и только пробная версия 1 является истинным положительным результатом: Trial Hamming Distance 1 0.34 2 0.37 3 0.34 4 0.29 5 0.55 6 0.47 …
9 mathematical-statistics  roc  classification  cross-validation  pac-learning  r  anova  survival  hazard  machine-learning  data-mining  hypothesis-testing  regression  random-variable  non-independent  normal-distribution  approximation  central-limit-theorem  interpolation  splines  distributions  kernel-smoothing  r  data-visualization  ggplot2  distributions  binomial  random-variable  poisson-distribution  simulation  kalman-filter  regression  lasso  regularization  lme4-nlme  model-selection  aic  r  mcmc  dlm  particle-filter  r  panel-data  multilevel-analysis  model-selection  entropy  graphical-model  r  distributions  quantiles  qq-plot  svm  matlab  regression  lasso  regularization  entropy  inference  r  distributions  dataset  algorithms  matrix-decomposition  regression  modeling  interaction  regularization  expected-value  exponential  gamma-distribution  mcmc  gibbs  probability  self-study  normality-assumption  naive-bayes  bayes-optimal-classifier  standard-deviation  classification  optimization  control-chart  engineering-statistics  regression  lasso  regularization  regression  references  lasso  regularization  elastic-net  r  distributions  aggregation  clustering  algorithms  regression  correlation  modeling  distributions  time-series  standard-deviation  goodness-of-fit  hypothesis-testing  statistical-significance  sample  binary-data  estimation  random-variable  interpolation  distributions  probability  chi-squared  predictor  outliers  regression  modeling  interaction 

2
Коррекция непрерывности Yates для 2 x 2 таблиц сопряженности
Я хотел бы собрать информацию от людей в этой области о корректировке непрерывности Йейтса для таблиц 2 x 2. В статье в Википедии упоминается, что она может слишком далеко отрегулироваться и поэтому используется только в ограниченном смысле. Родственный пост здесь не предлагает гораздо более глубокий. Итак, что вы думаете о …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.