Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Смещение оценок максимального правдоподобия для логистической регрессии
Я хотел бы понять несколько фактов о максимальных вероятностных оценках (MLE) для логистических регрессий. Правда ли, что в целом MLE для логистической регрессии является предвзятой? Я бы сказал "да". Я знаю, например, что размер выборки связан с асимптотическим смещением MLE. Знаете ли вы какие-нибудь элементарные примеры этого явления? Если MLE …

1
Методы наказания за категориальные данные: объединение уровней в фактор
Наказанные модели могут использоваться для оценки моделей, в которых количество параметров равно или даже превышает размер выборки. Такая ситуация может возникнуть в лог-линейных моделях больших разреженных таблиц категориальных данных или данных подсчета. В этих настройках часто также желательно или полезно сворачивать таблицы, комбинируя уровни фактора, где эти уровни не различимы …

1
Какую загрузочную регрессионную модель мне выбрать?
У меня есть бинарная модель логистической регрессии с DV (болезнь: да / нет) и 5 ​​предикторами (демография [возраст, пол, курение табака (да / нет)], медицинский индекс (порядковый номер) и одно случайное лечение [да / нет ]). Я также смоделировал все двусторонние условия взаимодействия. Основные переменные центрированы, и нет признаков мультиколлинеарности …

3
Измерение некоторых пациентов более одного раза
Я провожу клиническое исследование, в котором я определяю антропометрическую меру пациентов. Я знаю, как справиться с ситуацией, когда у меня есть одно измерение на пациента: я делаю модель, где у меня есть случайная выборка с некоторой плотностью , и я делаю обычные вещи: напишите вероятность выборка, оценка параметров, определение доверительных …
10 inference 

1
Ожидаемое количество дубликатов (трижды и т. Д.) При рисовании с заменой
У меня есть следующая проблема: У меня есть 100 уникальных предметов (n), и я выбираю 43 (м) из них по одному (с заменой). Мне нужно найти ожидаемое количество уникальных (только один раз выбрано, k = 1), двойных чисел (выбрано ровно дважды k = 2), тройных чисел (ровно k = 3), …

4
Модель истории дискретного времени (выживания) в R
Я пытаюсь вписать модель с дискретным временем в R, но я не уверен, как это сделать. Я читал, что вы можете организовать зависимую переменную в разных строках, по одной для каждого временного наблюдения, и использовать glmфункцию со ссылкой logit или cloglog. В этом смысле, у меня есть три колонки: ID, …
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

2
Какие хорошие ресурсы для истории анализа временных рядов?
Я проверил ответ на этот вопрос на stats.stackexchange: Какие хорошие ресурсы предоставляют историю статистики? Действительно, книга Стиглера «Статистика на столе» выглядит превосходно, и я с нетерпением жду ее прочтения. Но меня больше интересует разработка современных моделей ARIMA. Я думаю, я помню, что слышал, что большой прогресс был стимулирован в попытке …

1
Вопрос по образцу автоковариантной функции
Я читаю книгу анализа временных рядов, и формула для автоковариации образца определена в книге как: γˆ( h ) = n- 1Σт = 1н - ч( хт + ч- х¯) ( хT- х¯)γ^(час)знак равноN-1ΣTзнак равно1N-час(ИксT+час-Икс¯)(ИксT-Икс¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) сдля . - это среднее.γˆ( - ч ) = γˆ(h)γ^(−h)=γ^(h)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\;ˉ xч = …


1
Задание члена Error () в повторных измерениях ANOVA в R
У меня проблемы с определением условий ошибки для двухсторонних повторяющихся измерений ANOVA в R. Мои данные состоят из оценок плотности древесины для трех радиальных положений (внутреннего, среднего и внешнего) вдоль керна, извлеченного из дерева. Всего существует 20 видов деревьев, 6 особей каждого вида и два ядра от каждого дерева. Чтобы …


2
Небольшие и несбалансированные размеры выборки для двух групп - что делать?
У меня есть данные для двух групп (то есть выборок), которые я хочу сравнить, но общий размер выборки небольшой (n = 29) и сильно несбалансированный (n = 22 против n = 7). Эти данные сложны с точки зрения логистики и дороги для сбора, поэтому «собрать больше данных» как очевидное решение …

3
Алгоритм машинного обучения для ранжирования
У меня есть набор элементов которые я могу описать в соответствии с n характеристиками. Таким образом:ИксИксXNNn Икся: { cя 1, ся 2, … , Ся н} ∣ хя∈ XИкся:{ся1,ся2,...,сяN}|Икся∈Иксx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X где - (числовая) оценка для элемента i согласно характеристикам j . Поэтому мои …


1
Что такое точечная дисперсия?
Читая «Элементы статистического обучения» , я несколько раз встречал термин «точечная дисперсия». Хотя у меня есть смутное представление о том, что это, вероятно, означает, я был бы рад узнать, Как это определяется? Как это происходит?
10 variance 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.