Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как я могу вычислить статистику теста Пирсона на отсутствие соответствия модели логистической регрессии в R?
Коэффициент отношения правдоподобия (он же отклонение) и критерий несоответствия (или качества соответствия) довольно просто получить для модели логистической регрессии (подгонка с использованием функции) в R. Однако это может быть легко подсчитать количество клеток в конечном итоге достаточно низко, чтобы тест был ненадежным. Один из способов проверить надежность теста отношения правдоподобия …

2
Что такое модель временного ряда для прогнозирования процентного соотношения (0,1)?
Это должно прийти вверх - прогнозирование вещей, которые застряли между 0 и 1. В моей серии я подозреваю, что компонент авторегрессии, а также компонент среднего обращения, поэтому я хочу что-то, что я могу интерпретировать, как ARIMA - но я не хочу, чтобы в будущем он снизился до 1000% , Вы …

1
R линейная регрессия категориальной переменной «скрытое» значение
Это всего лишь пример, с которым я сталкивался несколько раз, поэтому у меня нет примеров данных. Запуск модели линейной регрессии в R: a.lm = lm(Y ~ x1 + x2) x1является непрерывной переменной x2является категориальным и имеет три значения, например, «Низкий», «Средний» и «Высокий». Однако вывод, заданный R, будет выглядеть примерно …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
На какие проблемы следует обращать внимание при объединении нескольких временных рядов?
Скажем, у меня есть ряд временных рядов, например, ряд записей температуры с разных станций в регионе. Я хочу получить единый температурный рекорд для всего региона, с помощью которого я мог бы описать аспекты регионального климата. Интуитивный подход может заключаться в том, чтобы просто брать среднее значение по всем станциям на …

2
Оптимальное соотношение случай / контроль в исследовании случай-контроль
Каково оптимальное соотношение случай / контроль в исследовании случай-контроль? Почему большинство учебников или монографий предполагают, что оно больше 1? Может ли оно быть меньше 1 (каковы недостатки?)? Спасибо.

2
Как распределяется ошибка вокруг данных логистического роста?
В экологии мы часто используем уравнение логистического роста: Nt=KN0ertK+N0ert−1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} или Nt=KN0N0+(K−N0)e−rtNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} где - пропускная способность (достигнута максимальная плотность), - начальная плотность, - скорость роста, - время с начальной.Н 0 г тKKKN0N0N_0rrrttt Значение …
10 r  distributions  pdf  ecology 

3
Марковские модели с условными переходными вероятностями
Во-первых, позвольте мне сразу признать, что я не настолько разбираюсь в статистике и математике, как хотелось бы. Некоторые могут сказать, что достаточно знаний, чтобы быть опасными. : D Я прошу прощения, если я не использую терминологию правильно. Я пытаюсь смоделировать вероятности перехода системы из одного состояния в другое. Простая марковская …

2
Как правильно обрабатывать несколько точек данных по каждому предмету
В настоящее время я спорю с кем-то о том, как правильно обрабатывать данные с несколькими измерениями для каждого субъекта. В этом случае данные были собраны для каждого субъекта в течение короткого времени для различных условий в каждом субъекте. Все измерения объединяют одну и ту же переменную, только несколько. Один из …

3
Где общая дисперсия между всеми IV в линейном уравнении множественной регрессии?
В линейном уравнении множественной регрессии, если веса бета отражают вклад каждой отдельной независимой переменной сверх вклада всех других IV, где в уравнении регрессии дисперсия, общая для всех IV, которые предсказывают DV? Например, если диаграмма Венна, показанная ниже (и взятая из страницы « About» резюме здесь: https://stats.stackexchange.com/about ), была помечена как …

2
Как моделировать многовариантные результаты в R?
В большинстве случаев мы имеем дело только с одной переменной результат / ответ, такой как . Однако в некоторых сценариях, особенно в клинических данных, переменные результата могут быть многомерными / многомерными. Например, , где содержит переменные , и и все эти результаты коррелированы. Если обозначает получение лечения (да / нет), …

3
Расстояние Махаланобиса через PCA, когда
У меня есть матрица , где - количество генов, а - количество пациентов. Любой, кто работал с такими данными, знает, что всегда больше, чем . Используя выбор функции, я получил к более разумному числу, однако все еще больше, чем .p n p n p p nn×pn×pn\times ppppnnnpppnnnppppppnnn Я хотел бы …

3
Как создать рекомендательную систему, которая объединяет функции совместной фильтрации и контента?
Я создаю систему Рекомендора и хочу включить как рейтинги «похожих» пользователей, так и особенности предметов. Результатом является прогнозируемый рейтинг [0-1]. Я рассматриваю нейронную сеть (для начала). Таким образом, входные данные представляют собой комбинацию характеристик предметов и рейтингов каждого пользователя. Для позиции A и пользователя 1 система может быть обучена на …

1
Отсутствующие значения в переменной ответа в JAGS
Гельман и Хилл (2006) говорят: В ошибках, пропущенные результаты в регрессии могут быть легко обработаны, просто включив вектор данных, NA и все. Ошибка явно моделирует выходную переменную, и поэтому тривиально использовать эту модель, чтобы влиять на пропущенные значения на каждой итерации. Это звучит как простой способ использовать JAGS для прогнозирования. …

1
Возражения против рандомизации
В « Клинических испытаниях - методологической перспективе» Стивен Пиантадоси пишет (гл. 13, стр. 334): В главе 2 я отметил возражения против рандомизации, сделанные Абелем и Кохом (1997) и Урбахом (1993), и указал на ценность изучения их проблем и возможных ошибок. Они отвергают рандомизацию как средство для проверки определенных статистических тестов, …

1
Доказательство последовательности уменьшается (поддерживается путем построения большого количества точек)
Многие из вопросов, которые я разместил на SE в прошлом месяце, были направлены на то, чтобы помочь мне решить эту конкретную проблему. На все вопросы ответили, но я все еще не могу найти решение. Итак, я решил, что мне нужно просто задать проблему, которую я пытаюсь решить напрямую. Пусть , …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.