Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как стохастический градиентный спуск может сэкономить время по сравнению со стандартным градиентным спуском?
Стандартный градиентный спуск будет вычислять градиент для всего набора обучающих данных. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Для заранее определенного числа эпох мы сначала вычисляем вектор градиента weights_grad функции потерь для всего набора данных с нашими параметрами вектора параметров. Stochastic …

2
Являемся ли мы частыми лицами на самом деле просто неявными / невольными байесовцами?
Для данной проблемы вывода мы знаем, что байесовский подход обычно отличается как по форме, так и по результатам феечистского подхода. Частые участники (обычно это я) часто указывают на то, что их методы не требуют предварительного и, следовательно, в большей степени «основаны на данных», чем «обусловлены суждениями». Конечно, байесовские указатели могут …

2
Что значит сказать, что событие «в конце концов случится»?
Рассмотрим одномерное случайное блуждание по целым числам ZZ\mathbb{Z} с начальным состоянием x∈Zx∈Zx\in\mathbb{Z} : Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} где приращения ξiξi\xi_i равны IID, так что P{ξi=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} . Можно доказать, что (1) Px{Sn reaches +1 eventually}=1Px{Sn reaches +1 eventually}=1\begin{equation} P^x{\{S_n \text{ reaches +1 eventually}\}} = 1 \end{equation} где нижний индекс обозначает начальную позицию. …

1
Написание математического уравнения для многоуровневой модели смешанных эффектов
Вопрос CV Я пытаюсь дать (а) подробное и краткое математическое представление (я) модели смешанных эффектов. Я использую lme4пакет в R. Каково правильное математическое представление для моей модели? Данные, научный вопрос и код R Мой набор данных состоит из видов в разных регионах. Я проверяю, изменяется ли распространенность вида во время, …

2
Чем ABC и MCMC отличаются в своих приложениях?
Насколько я понимаю, приблизительные байесовские вычисления (ABC) и цепь Маркова Монте-Карло (MCMC) имеют очень похожие цели. Ниже я опишу свое понимание этих методов и то, как я воспринимаю различия в их применении к реальным данным. Приближенное байесовское вычисление ABC состоит из выборки параметра θθ\theta из предшествующего, посредством численного моделирования вычисляют …

4
Точность градиентной машины уменьшается с увеличением числа итераций
Я экспериментирую с алгоритмом машины повышения градиента через caretпакет в R. Используя небольшой набор данных для поступления в колледж, я запустил следующий код: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting machine algorithm. …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

2
Выборка из неправильного распределения (с использованием MCMC и других)
Мой основной вопрос: как бы вы пробовали неправильный дистрибутив? Имеет ли смысл пробовать неправильный дистрибутив? Здесь комментарии Сианя как бы касаются вопроса, но я искал некоторые подробности по этому поводу. Более конкретно для MCMC: Говоря о MCMC и читая статьи, авторы подчеркивают, что получили правильные апостериорные распределения. Есть знаменитая газета …

1
Какие хорошие вопросы для собеседования для кандидатов на разработку статистического алгоритма?
Я беру интервью у людей на позицию разработчика / исследователя алгоритма в контексте статистики / машинного обучения / интеллектуального анализа данных. Я ищу вопросы, которые нужно задать, чтобы определить, в частности, знакомство, понимание и гибкость кандидата с базовой теорией, например, основные свойства ожидания и дисперсии, некоторые общие распределения и т. …

2
Ожидаемое количество раз, чтобы бросить кубик, пока каждая сторона не появится 3 раза
Какое ожидаемое количество раз вы должны бросить кубик, пока каждая сторона не появится 3 раза? Этот вопрос был задан в начальной школе в Новой Зеландии, и он был решен с помощью моделирования. Каково аналитическое решение этой проблемы?

2
Ошибка «из сумки» делает резюме ненужным в случайных лесах?
Я довольно новичок в случайных лесах. В прошлом я всегда сравнивал точность подгонки к тесту с подгонкой к тренировке, чтобы обнаружить любое переоснащение. Но я только что прочитал здесь, что: «В случайных лесах нет необходимости в перекрестной проверке или отдельном наборе тестов, чтобы получить объективную оценку ошибки набора тестов. Она …

2
Почему апостериорное распределение в байесовском выводе часто трудноразрешимо?
У меня проблемы с пониманием, почему байесовский вывод приводит к неразрешимым проблемам. Проблема часто объясняется так: Я не понимаю, почему этот интеграл нужно оценивать в первую очередь: мне кажется, что результатом интеграла является просто нормализационная константа (как дан набор данных D). Почему нельзя просто вычислить апостериорное распределение как числитель правой …

2
Предсказания от модели BSTS (в R) полностью проваливаются
Прочитав этот пост в блоге о байесовских моделях структурных временных рядов, я хотел взглянуть на реализацию этого в контексте проблемы, для которой я ранее использовал ARIMA. У меня есть некоторые данные с некоторыми известными (но шумными) сезонными компонентами - это определенно есть ежегодные, ежемесячные и еженедельные компоненты, а также некоторые …
15 r  time-series  bayesian  mcmc  bsts 

3
Оценка вероятности в процессе Бернулли путем выборки до 10 отказов: является ли она предвзятой?
Предположим, у нас есть процесс Бернулли с вероятностью отказа (который будет мал, скажем, q ≤ 0,01 ), из которого мы производим выборку, пока не встретим 10 отказов. Таким образом , мы оцениваем вероятность отказа , как д : = 10 / N , где N представляет собой число выборок.qqqq≤0.01q≤0.01q \leq …

5
Статистические различия в двух квалификационных форматах Формулы 1
Я только что прочитал эту статью BBC о квалификационном формате в Формуле 1. Организаторы хотят сделать квалификацию менее предсказуемой, то есть увеличить статистические различия в результате. Заметив несколько не относящихся к делу деталей, на данный момент гонщики оцениваются по их лучшим одиночным кругам из (для конкретности) двух попыток. Один из …
15 variance 

1
Почему эта регрессия НЕ терпит неудачу из-за совершенной мультиколлинеарности, хотя одна переменная является линейной комбинацией других?
Сегодня я играл с небольшим набором данных и выполнил простую регрессию OLS, которую я ожидал потерпеть неудачу из-за совершенной мультиколлинеарности. Однако это не так. Это подразумевает, что мое понимание мультиколлинеарности неверно. Мой вопрос: где я не прав? Я думаю, что могу показать, что одна из моих переменных является линейной комбинацией …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.