Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Прогнозирование на моделях со смешанным эффектом: что делать со случайными эффектами?
Давайте рассмотрим этот гипотетический набор данных: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) мы можем использовать lmeдля моделирования ответа с моделью случайного эффекта: require(nlme) model <- …

1
Большая выборка асимптотик / теория - зачем заботиться?
Я надеюсь, что этот вопрос не будет помечен как «слишком общий», и надеюсь, что начнется обсуждение, которое принесет пользу всем. В статистике мы тратим много времени на изучение больших выборочных теорий. Мы глубоко заинтересованы в оценке асимптотических свойств наших оценок, в том числе в отношении того, являются ли они асимптотически …

4
Интерполяция данных по гриппу, сохраняющих среднее значение за неделю
редактировать Я нашел статью с описанием именно той процедуры, которая мне нужна. Единственное отличие состоит в том, что документ интерполирует среднемесячные данные на ежедневные, сохраняя при этом среднемесячные значения. У меня есть проблемы, чтобы реализовать подход в R. Любые намеки приветствуются. оригинал Для каждой недели у меня есть следующие данные …

1
Являются ли уместными стандартные ошибки и доверительные интервалы в регрессиях, где допущение гомоскедастичности нарушено?
Если в стандартных регрессиях OLS нарушаются два предположения (нормальное распределение ошибок, гомоскедастичность), является ли начальная загрузка стандартных ошибок и доверительных интервалов подходящей альтернативой для получения значимых результатов в отношении значимости коэффициентов регрессора? Тесты значимости с загруженными стандартными ошибками и доверительными интервалами все еще работают с гетероскедастичностью? Если да, то какие …

3
Как вычислить повернутые варимаксом главные компоненты в R?
Я запустил PCA на 25 переменных и выбрал лучшие 7 компьютеров, используя prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Затем я сделал ротацию варимакса для этих компонентов. varimax7 <- varimax(prc$rotation[,1:7]) А теперь я хочу, чтобы varimax вращал данные, повернутые PCA (поскольку они не являются частью объекта varimax - только матрица …
13 r  pca  factor-rotation 


3
Кластер больших данных в R и имеет ли значение выборка?
Я новичок в науке о данных, и у меня проблема с поиском кластеров в наборе данных с 200 000 строк и 50 столбцов в R. Поскольку данные имеют как числовые, так и номинальные переменные, такие методы, как K-средства, которые используют евклидову меру расстояния, не кажутся подходящим выбором. Поэтому я перехожу …

3
Что означают нормальные остатки и что это говорит мне о моих данных?
Довольно простой вопрос: Что означает нормальное распределение остатков от линейной регрессии? С точки зрения того, как это отражается на моих исходных данных регрессии? Я в полном замешательстве, спасибо, ребята

3
Как я могу предсказать шансы на победу команды доджбола на основе истории побед своих игроков?
Представьте, что в мире есть 80 игроков в доджбол. Каждый из них играл в тысячи игр в доджбол с другими 79 игроками в более или менее случайном порядке. Это мир без команд (например, у каждого игрока есть шанс попасть в любую команду в каждой игре). Я знаю предыдущий коэффициент выигрыша …

4
Уместно ли отобразить среднее значение в гистограмме?
Можно ли добавить вертикальную линию к гистограмме для визуализации среднего значения? Мне кажется, это нормально, но я никогда не видел этого в учебниках и тому подобном, поэтому мне интересно, есть ли какое-то соглашение не делать этого? График предназначен для курсовой работы, я просто хочу убедиться, что случайно не нарушил какое-то …

1
R-квадрат в линейной модели отклонения стихов в обобщенной линейной модели?
Вот мой контекст для этого вопроса: Из того, что я могу сказать, мы не можем запустить обычную регрессию наименьших квадратов в R при использовании взвешенных данных и surveyпакета. Здесь мы должны использовать svyglm(), который вместо этого запускает обобщенную линейную модель (что может быть тем же самым? Я нечеткий здесь с …

3
Сумма двух независимых гамма-случайных величин
Согласно статье в Википедии о гамма-распределении : Если X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta) и Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta) , где XXX и YYY - независимые случайные величины, то X+Y∼Gamma(a+b,θ)X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) . Но я не вижу никаких доказательств. Кто-нибудь может указать мне на его доказательство, пожалуйста? Изменить: Большое спасибо Zen, а также я нашел ответ в качестве …

3
F-статистика, F-критическое значение и P-значение
Я очень новичок в этой области, и мне трудно понять концепцию отклонения нулевой гипотезы на основе результатов таблицы ANOVA. Как рассчитанное F и критическое значение соотносятся с p-значением? И если вычисленное F больше 1, означает ли это, что нулевая гипотеза должна быть отвергнута, даже если значение p меньше альфа? Извините, …
13 anova 

1
Понимание прогнозов из логистической регрессии
Мои прогнозы, основанные на модели логистической регрессии (glm в R), не ограничены между 0 и 1, как я ожидал. Мое понимание логистической регрессии состоит в том, что ваши входные параметры и параметры модели объединяются линейно, и ответ преобразуется в вероятность с помощью функции связи logit. Поскольку функция логита ограничена между …

2
Как обстоят дела с автокорреляцией?
Для предисловия у меня достаточно глубокие математические знания, но я никогда не имел дело с временными рядами или статистическим моделированием. Так что не надо быть очень нежным со мной :) Я читаю эту статью о моделировании использования энергии в коммерческих зданиях, и автор делает следующее заявление: [Присутствие автокорреляции возникает] потому, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.