Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Шаги, сделанные в факторном анализе, по сравнению с шагами, выполненными в PCA
Я знаю, как выполнить PCA (анализ основных компонентов), но мне хотелось бы знать шаги, которые следует использовать для факторного анализа. Чтобы выполнить PCA, давайте рассмотрим некоторую матрицу , например:AAA 3 1 -1 2 4 0 4 -2 -5 11 22 20 Я рассчитал его корреляционную матрицу B = corr(A): 1.0000 …

3
Как нормализовать данные неизвестного распределения
Я пытаюсь найти наиболее подходящее характеристическое распределение данных повторных измерений определенного типа. По сути, в моей области геологии мы часто используем радиометрическое датирование минералов из образцов (кусков породы), чтобы выяснить, как давно произошло событие (камень охлажден ниже пороговой температуры). Как правило, несколько (3-10) измерений будут сделаны из каждого образца. Затем …

1
Почему бы не всегда использовать загрузочные CI?
Мне было интересно, как загрузочные CI (и BCa в barticular) работают на нормально распределенных данных. Похоже, что было проделано много работы по изучению их производительности в различных типах дистрибутивов, но ничего не удалось найти в нормально распределенных данных. Поскольку кажется очевидным, что изучать в первую очередь, я полагаю, что бумаги …

5
Как выполнить вменение значений в очень большом количестве точек данных?
У меня очень большой набор данных и около 5% случайных значений отсутствуют. Эти переменные связаны друг с другом. В следующем примере набор данных R - просто игрушечный пример с фиктивными коррелированными данными. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 

1
Модель Лмера не сходится
Мои данные описаны здесь. Что может вызвать «Ошибка () модель сингулярной ошибки» в AOV при подборе повторяющихся мер ANOVA? Я пытаюсь увидеть эффект взаимодействия, используя lmerмой базовый случай: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) Запуск anovaдает …
12 r  lme4-nlme 

2
Можем ли мы сделать вероятностные утверждения с интервалами прогнозирования?
Я прочитал много отличных обсуждений на сайте относительно интерпретации доверительных интервалов и интервалов прогнозирования, но одна концепция все еще немного озадачивает: Рассмотрим структуру OLS, и мы получили подходящую модель . Нам дали и попросили предсказать его ответ. Мы вычисляем и, в качестве бонуса, мы также предоставляем интервал прогнозирования 95% вокруг …


2
Почему это распределение равномерно?
Мы изучаем байесовское статистическое тестирование и сталкиваемся со странным (по крайней мере, мне) явлением. Рассмотрим следующий случай: мы заинтересованы в измерении того, какая популяция, A или B, имеет более высокий коэффициент конверсии. Для проверки мы устанавливаем , то есть вероятность конверсии одинакова в обеих группах. Мы генерируем искусственные данные, используя …

2
Дисперсионно-ковариационная матричная интерпретация
Предположим, у нас есть линейная модель Model1и vcov(Model1)дает следующую матрицу: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Для этого примера, что на самом деле отображает эта матрица? Какие предположения мы можем безопасно сделать …

1
Отчетность о результатах линейной модели смешанных эффектов
Линейные модели со смешанными эффектами обычно не используются в моей области биологии, и мне нужно сообщить о статистическом тесте, который я использовал в статье, которую я пытаюсь написать. Я знаю, что осведомленность о многоуровневом моделировании начинает появляться в некоторых областях бионаук ( решение зависимости: использование многоуровневого анализа для размещения вложенных …

2
Интеллектуальная оценка и определение победителя
Существует подкаст NPR под названием Intelligence Squared. Каждый эпизод - это прямая трансляция дебатов по некоторым спорным заявлениям, таким как «Вторая поправка больше не актуальна» или «Позитивные действия в студенческих городках приносят больше вреда, чем пользы». Четыре представителя спорят - два за движение и два против. Чтобы определить, какая сторона …
12 bayesian  rating 

1
Как выполнить тест начальной загрузки, чтобы сравнить средства двух образцов?
У меня есть две сильно искаженные выборки, и я пытаюсь использовать начальную загрузку, чтобы сравнить их с помощью t-статистики. Как правильно это сделать? Процесс, который я использую Я обеспокоен целесообразностью использования стандартной ошибки исходных / наблюдаемых данных на последнем этапе, когда я знаю, что это обычно не распространяется. Вот мои …

3
Лучше выбрать распределение на основе теории, подгонки или что-то еще?
Это граничит с философским вопросом, но мне интересно, как другие люди с большим опытом думают о выборе распределения. В некоторых случаях кажется ясным, что теория могла бы работать лучше (длины хвоста мышей, вероятно, нормально распределены). Во многих случаях, вероятно, нет теории для описания набора данных, так что вы просто используете …

2
Проверка невязок на нормальность в обобщенных линейных моделях
Эта статья использует обобщенные линейные модели (как биномиальное, так и отрицательное биномиальное распределение ошибок) для анализа данных. Но затем в разделе методов статистического анализа есть следующее утверждение: ... и, во-вторых, путем моделирования данных присутствия с использованием моделей логистической регрессии и данных о времени нагула с использованием обобщенной линейной модели (GLM). …

1
Как я могу обучить HMM для классификации?
Итак, я понимаю, что когда вы готовите HMM для классификации, стандартный подход: Разделите ваши наборы данных на наборы данных для каждого класса Тренируйте один HMM в классе На тестовом наборе сравните вероятность каждой модели для классификации каждого окна Но как мне тренировать HMM в каждом классе? Должен ли я просто …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.