Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Статистическое тестирование
Мне нужно найти соответствующий статистический тест (тест отношения правдоподобия, t-тест и т. Д.) По следующему: Позвольте быть IID образец случайного вектора ( X , Y ) и предположим , что ( У Х ) ~ N [ ( μ 1 μ 2 ) , ( 1 0,5 0,5 1 ) …

2
Могу ли я использовать начальную загрузку, почему или почему нет?
В настоящее время я работаю над оценками биомассы с использованием спутниковых изображений. Я быстро определю фон своего вопроса, а затем объясню статистический вопрос, над которым я работаю. Фон проблема Я пытаюсь оценить биомассу во Франции. Мой ответ - объемная плотность паровой древесины (в ), которая более или менее пропорциональна биомассе …
10 bootstrap 

2
Почему важны дистрибутивы?
Это может также пойти вниз, как самые глупые вопросы, когда-либо задаваемые на этом форуме, но, получив здравые и содержательные ответы на предыдущий вопрос, я подумал, что снова протяну свою удачу. В течение некоторого времени я был очень озадачен важностью статистического распределения, особенно в части, касающейся доходности активов и, более конкретно, …

2
Как я могу смоделировать пропорции с BUGS / JAGS / STAN?
Я пытаюсь построить модель, в которой ответ является пропорцией (фактически это доля голосов, которую партия получает в избирательных округах). Его распределение не является нормальным, поэтому я решил смоделировать его с помощью бета-версии. У меня также есть несколько предикторов. Однако я не знаю, как написать это в BUGS / JAGS / …

2
Возможно ли иметь переменную, которая действует как модификатор эффекта и как определяющий фактор?
Возможно ли иметь переменную, которая действует как модификатор эффекта (измерения) и как фактор, влияющий на данную пару ассоциаций риск-результат? Я все еще немного не уверен в различии. Я посмотрел на графические обозначения, чтобы помочь мне понять разницу, но различия в обозначениях сбивают с толку. Графическое / визуальное объяснение двух и …

1
Как бороться со смертью в анализе выживаемости без болезней?
Если у меня есть данные о выживаемости без заболевания (определяется как то, было ли диагностировано конкретное заболевание или нет, а также время до этого события или потери), а также общие данные о выживании, как мне поступить со смертельными случаями, которые происходят без событие болезни? Они подвергнуты цензуре или я должен …

1
Гауссово распределение с моментами высшего порядка
Для гауссовского распределения с неизвестным средним и дисперсией достаточная статистика в стандартной экспоненциальной форме семейства . У меня есть распределение , которое имеет Т ( х ) = ( х , х 2 , . . . , Х 2 Н )T( х ) = ( х , х2)T(Икс)знак равно(Икс,Икс2)T(x)=(x,x^2)T( …

3
Анализ мощности для биномиальных данных, когда нулевая гипотеза состоит в том, что
Я хотел бы провести анализ мощности для одной выборки из биномиальных данных, с , по сравнению с , где - это доля успехов в популяции. Если , я мог бы использовать либо нормальное приближение к биномиальному, либо -test, но при оба эти значения не пройдены. Я хотел бы знать, есть …

1
Почему Anova () и drop1 () предоставили разные ответы для GLMM?
У меня есть GLMM формы: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Когда я использую drop1(model, test="Chi"), я получаю другие результаты, чем если бы я использовал Anova(model, type="III")из пакета автомобиля или summary(model). Последние два дают одинаковые ответы. Используя кучу сфабрикованных данных, я обнаружил, …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

2
Оценка кластеров цепей Маркова первого порядка
Я сгруппировал свой набор данных из нескольких тысяч цепей Маркова первого порядка примерно в 10 кластеров. Есть ли какой-нибудь рекомендуемый способ, как я могу оценить эти кластеры и выяснить, какие элементы в кластерах совместно используются и как они отличаются от других кластеров? Таким образом, я могу сделать заявление типа «Процессы …

2
Как генерировать числа в соответствии с распределением Солитон?
Распределение солитонов - это дискретное распределение вероятностей по набору с функцией вероятности{ 1 , … , N}{1,…,N}\{1,\dots, N\} р ( 1 ) = 1N,p ( k ) = 1к ( к - 1 )для k ∈ { 2 , … , N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} Я хотел бы …

3
Откуда появился термин «выучить модель»
Часто я слышал, что майнеры данных используют этот термин. Как статистик, который работал над проблемами классификации, я знаком с термином «обучить классификатора», и я предполагаю, что «выучить модель» означает то же самое. Я не против термина «обучить классификатора». Кажется, это изображает идею подгонки модели, поскольку данные обучения используются для получения …

1
Исправление для нормально распределенной точности часов
У меня есть эксперимент, который выполняется на сотнях компьютеров, распределенных по всему миру, который измеряет случаи определенных событий. Каждое событие зависит друг от друга, поэтому я могу расположить их в порядке возрастания, а затем рассчитать разницу во времени. События должны быть экспоненциально распределены, но при построении гистограммы я получаю следующее: …

1
Байесовские факторы с неподходящими априорами
У меня есть вопрос относительно сравнения моделей с использованием байесовских факторов. Во многих случаях статистики заинтересованы в использовании байесовского подхода с неподходящими априорами (например, с некоторыми априорами Джеффриса и эталонными априорами). Мой вопрос заключается в том, что в тех случаях, когда апостериорное распределение параметров модели четко определено, допустимо ли сравнивать …

2
Смущенный о доверительном интервале
Меня смущает понятие доверительного интервала. В частности, предположим, что существует гауссовская переменная X∼N(μ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma) с известным σσ\sigma , и меня интересует нижняя граница μLμL\mu_L среднего значения с уровнем достоверности 95%95%95\% . Я проведу эксперимент 555 раз и буду наблюдать X1X1X_1 , X2X2X_2 , X3X3X_3 , X4X4X_4 , X5X5X_5 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.