Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Были ли воспроизведены современные результаты использования векторов абзацев для анализа настроений?
Я был впечатлен результатами в работе ICML 2014 года « Распределенное представление предложений и документов » Ле и Миколова. Техника, которую они описывают, называемая «векторами абзацев», изучает неконтролируемые представления произвольно длинных абзацев / документов на основе расширения модели word2vec. В статье сообщается о современных достижениях в анализе настроений с использованием …

2
Как интерпретировать эти графики acf и pacf
Ниже приведены графики acf и pacf ежемесячного ряда данных. Второй график - это acf с ci.type = 'ma': Сохранение высоких значений на графике acf, вероятно, представляет долгосрочную положительную тенденцию. Вопрос в том, представляют ли это сезонные колебания? Я пытался увидеть разные сайты на эту тему, но я не уверен, что …

4
Насколько плоха настройка гиперпараметра вне перекрестной проверки?
Я знаю, что выполнение настройки гиперпараметра вне перекрестной проверки может привести к смещенно высоким оценкам внешней достоверности, потому что набор данных, который вы используете для измерения производительности, тот же, который вы использовали для настройки функций. Мне интересно, насколько это плохо . Я могу понять, как это было бы очень плохо …

1
Почему оценочные значения из Лучшего линейного несмещенного предиктора (BLUP) отличаются от Лучшего линейного несмещенного оценщика (BLUE)?
Я понимаю, что разница между ними связана с тем, оценивается ли группирующая переменная в модели как фиксированный или случайный эффект, но мне не ясно, почему они не одинаковы (если они не совпадают). Меня особенно интересует, как это работает при использовании оценки небольшой площади, если это уместно, но я подозреваю, что …

2
Есть ли какое-либо преимущество SVD перед PCA?
Я знаю, как математически рассчитать PCA и SVD, и я знаю, что оба могут быть применены к регрессии линейных наименьших квадратов. Основным преимуществом SVD математически представляется то, что его можно применять к неквадратным матрицам. Оба сосредоточены на разложении матрицыПомимо упомянутого преимущества SVD, есть ли какие-либо дополнительные преимущества или идеи, предоставляемые …
20 pca  least-squares  svd 

1
Как использовать дельта-метод для стандартных ошибок предельных эффектов?
Меня интересует лучшее понимание дельта-метода для аппроксимации стандартных ошибок средних предельных эффектов регрессионной модели, включающей термин взаимодействия. Я посмотрел на связанные вопросы в рамках дельта-метода, но ни один из них не дал того, что я ищу. Рассмотрим следующие данные в качестве мотивирующего примера: set.seed(1) x1 <- rnorm(100) x2 <- rbinom(100,1,.5) …

6
Является ли медиана типом среднего для некоторого обобщения «среднего»?
Понятие «среднее» бродит гораздо шире, чем традиционное среднее арифметическое; это простирается так далеко, чтобы включить медиану? По аналогии необработанные данные ⟶Я бынеобработанные данные ⟶жадныйсырое среднее ⟶Я бы- 1среднее арифметическоенеобработанные данные ⟶Recipвзаимные ⟶жадныйзначит взаимный ⟶Recip- 1среднее гармоническоенеобработанные данные ⟶журналжурналы ⟶жадныйсредний журнал logжурнал- 1среднее геометрическоенеобработанные данные ⟶площадьквадраты ⟶жадныйсредняя площадь ⟶площадь- 1среднеквадратичное значениенеобработанные …
20 mean  average  median 


1
Как получить значение среднеквадратичной ошибки в линейной регрессии в R
Пусть модель линейной регрессии, полученная функцией R lm, хотела бы знать, можно ли ее получить с помощью команды Mean Squared Error. У меня был СЛЕДУЮЩИЙ вывод примера > lm <- lm(MuscleMAss~Age,data) > sm<-summary(lm) > sm Call: lm(formula = MuscleMAss ~ Age, data = data) Residuals: Min 1Q Median 3Q Max …
20 r  regression  error 

2
Методы расчета факторных оценок и что такое матрица «коэффициентов оценки» в PCA или факторный анализ?
Насколько я понимаю, в PCA, основанном на корреляциях, мы получаем фактор (= основной компонент в данном случае) нагрузки, которые являются ничем иным, как корреляцией между переменными и факторами. Теперь, когда мне нужно сгенерировать факторные оценки в SPSS, я могу напрямую получить факторные оценки каждого респондента для каждого фактора. Я также …

2
Выборка Гиббса по сравнению с общим MH-MCMC
Я только что прочитал о выборке Гиббса и алгоритме Метрополиса Гастингса и у меня есть пара вопросов. Насколько я понимаю, в случае выборки Гиббса, если у нас большая многомерная задача, мы выбираем из условного распределения, то есть выбираем одну переменную, сохраняя все остальные фиксированными, тогда как в MH мы выбираем …

4
Существует ли алгоритм в виде дерева решений для неконтролируемой кластеризации?
У меня есть набор данных, состоящий из 5 функций: A, B, C, D, E. Все они являются числовыми значениями. Вместо кластеризации на основе плотности я хочу кластеризовать данные в виде дерева решений. Подход, который я имею в виду, выглядит примерно так: Алгоритм может делить данные на X исходных кластеров на …

3
Коэффициент тестовой модели (наклон регрессии) относительно некоторого значения
В R, когда у меня есть (обобщенная) линейная модель ( lm, glm, gls, glmm, ...), как я могу проверить коэффициент (регрессионный наклон) в отношении любого другого значения , чем 0? В сводке модели результаты t-теста коэффициента автоматически сообщаются, но только для сравнения с 0. Я хочу сравнить его с другим …
20 r  regression  t-test 

2
KKT против неограниченной формулировки регрессии лассо
Наказанная регрессия L1 (иначе лассо) представлена ​​в двух формулировках. Пусть две целевые функции: Тогда две разные формулировки: подчиняется и, что то же самое, Используя условия Каруша-Куна-Такера (KKT), легко увидеть, как условие стационарности для первой формулировки эквивалентно принятию градиента второй формулировки и установке его равным 0. Что я не могу найти …

2
Байесовский анализ выживания: пожалуйста, напишите мне априор для Kaplan Meier!
Рассмотрим наблюдения, прошедшие цензуру справа, с событиями в моменты времени t1,t2,…t1,t2,…t_1, t_2, \dots . Число восприимчивых людей в момент времени iii равно ninin_i , а количество событий в момент времени iii равно didid_i . Оценка Каплана-Мейера или продукта возникает естественным образом как MLE, когда функция выживания является ступенчатой ​​функцией S(t)=∏i:ti<tαiS(t)=∏i:ti<tαiS(t) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.