Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как симулировать функциональные данные?
Я пытаюсь проверить различные подходы анализа функциональных данных. В идеале я хотел бы протестировать панель подходов, которые у меня есть, на смоделированных функциональных данных. Я попытался сгенерировать смоделированный FD, используя подход, основанный на суммировании гауссовских шумов (код ниже), но полученные кривые выглядят слишком грубыми по сравнению с реальными . Мне …

6
Если вы используете точечную оценку, которая максимизирует
Если кто-то сказал «Этот метод использует MLE точечную оценку для параметра, который максимизирует , поэтому он частый; и, кроме того, он не байесовский».P ( x | θ )P(x|θ)\mathrm{P}(x|\theta) Вы бы согласились? Обновление на фоне : я недавно прочитал газету, которая утверждает, что часто. Я не согласен с их утверждением, в …

2
Как бороться с потолочным эффектом благодаря измерительному инструменту?
Я собрал психофизиологические данные, измеряющие способность испытуемых (двух групп) воспринимать вибрацию. Вибрирующий зонд перемещается к коже при меньшем и меньшем смещении, и субъект указывает, когда он чувствует вибрацию. К сожалению, на высоких частотах датчик может перемещаться только на небольшое расстояние, и иногда наибольшее расстояние, которое может перемещать датчик, все еще …

1
Как генерировать прогнозы с помощью rjags?
Я использовал rjags для запуска MCMC на модели, указанной на языке JAGS. Есть ли хороший способ извлечь эту модель и выполнить с ней предсказания (используя апостериорные распределения моих параметров)? Я могу переопределить модель в R и подключить режимы своих параметров для постеров; Мне просто интересно, есть ли менее излишний способ …
12 r  jags 

2
Автоматически определять распределение вероятностей с учетом набора данных
Учитывая набор данных: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Я хотел бы определить наиболее подходящее распределение вероятностей (гамма, бета, нормальное, экспоненциальное, пуассоновское, хи-квадрат и т. Д.) С оценкой параметров. Мне уже известен вопрос по следующей ссылке, где решение предоставляется с использованием R: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- Непрерывное-одномерное-распределение-f лучшее предлагаемое решение следующее: > library(MASS) > fitdistr(x, …

3
Определите, значительно ли улучшился распределенный процесс с тяжелыми хвостами
Я наблюдаю время обработки процесса до и после изменения, чтобы выяснить, улучшился ли процесс в результате изменения. Процесс улучшился, если время обработки сократилось. Распределение времени обработки жирнохвостое, поэтому сравнение по среднему показателю нецелесообразно. Вместо этого я хотел бы знать, значительно ли вероятность наблюдать меньшее время обработки после изменения выше 50%. …

1
Есть ли связь между эмпирическим байесовским эффектом и случайными эффектами?
Недавно мне довелось прочитать об эмпирическом байесовском опыте (Casella, 1985, Введение в эмпирический анализ байесовских данных), и это выглядело как модель случайных эффектов; в том, что оба имеют оценки, уменьшенные до глобального среднего. Но я не прочитал это полностью ... Есть ли у кого-нибудь понимание сходства и различий между ними?

2
Как вы объясните разницу между относительным риском и абсолютным риском?
На днях у меня была консультация с эпидемиологом. Она является доктором медицины, имеет степень общественного здравоохранения в области эпидемиологии и обладает большим статистическим опытом. Она наставляет своих научных сотрудников и жителей и помогает им в статистических вопросах. Она хорошо понимает проверку гипотез. У нее была типичная проблема сравнения двух групп, …

1
Различия между PROC Mixed и lme / lmer в R - степени свободы
Примечание: этот вопрос является репостом, так как мой предыдущий вопрос пришлось удалить по юридическим причинам. Сравнивая PROC MIXED из SAS с функцией lmeиз nlmeпакета в R, я наткнулся на некоторые довольно запутанные различия. Более конкретно, степени свободы в разных тестах различаются между PROC MIXEDи lme, и я задавался вопросом, почему. …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 


5
Расчет расхождения Дженсена-Шеннона для 3-х вероятных распределений: это нормально?
Я хотел бы рассчитать дивергенцию Дженсена-Шеннона для следующих трех распределений. Является ли приведенный ниже расчет правильным? (Я следовал формуле JSD из Википедии ): P1 a:1/2 b:1/2 c:0 P2 a:0 b:1/10 c:9/10 P3 a:1/3 b:1/3 c:1/3 All distributions have equal weights, ie 1/3. JSD(P1, P2, P3) = H[(1/6, 1/6, 0) + …

1
Почему квадрат
Это может быть основной вопрос, но мне было интересно, почему значение в регрессионной модели может быть просто возведено в квадрат, чтобы дать цифру объясненной дисперсии?рRR Я понимаю, что коэффициент может дать силу отношения, но я не понимаю, как просто возводить в квадрат это значение дает меру объясненной дисперсии.рRR Любое простое …

1
Какой смысл в неинформативных априорах?
Почему даже есть неинформативные приоры? Они не предоставляют информацию о . Так зачем их использовать? Почему бы не использовать только информационные приоры? Например, предположим, что θ ∈ [ 0 , 1 ] . Тогда является ли θ ∼ U ( 0 , 1 ) неинформативным априорным для θ ?θθ\thetaθ∈[0,1]θ∈[0,1] \theta …

3
Выбор альтернатив пуассоновской регрессии для данных о сверхдисперсных счетчиках
В настоящее время я анализирую данные из серии поведенческих экспериментов, которые все используют следующую меру. Участников этого эксперимента просят выбрать подсказки, которые (вымышленные) другие люди могли бы использовать, чтобы помочь решить серию из 10 анаграмм. Участники должны верить, что эти другие люди либо получат, либо потеряют деньги, в зависимости от …

1
Как вы выбираете переменные в регрессионной модели?
Традиционный подход к выбору переменных заключается в поиске переменных, которые в наибольшей степени способствуют прогнозированию нового ответа. Недавно я узнал об альтернативе этому. При моделировании переменных, которые определяют эффект лечения, как, например, в клинических испытаниях фармацевтических препаратов, говорят, что переменная качественно взаимодействуетс лечением, если, если оставить другие вещи фиксированными, изменение …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.