Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как я должен интерпретировать статистику GAP?
Я использовал статистику GAP для оценки k кластеров в R. Однако я не уверен, правильно ли я ее интерпретирую. Из приведенного выше графика я предполагаю, что я должен использовать 3 кластера. Из второго сюжета я должен выбрать 6 кластеров. Это правильная интерпретация статистики GAP? Буду благодарен за любое объяснение.
10 clustering 

1
Коэффициент дисперсии инфляции для обобщенных аддитивных моделей
В обычном расчете VIF для линейной регрессии каждая независимая / пояснительная переменная рассматривается как зависимая переменная в обычной регрессии наименьших квадратов. т.е.ИксJXjX_j ИксJ= β0+ ∑я = 1 , я ≠ jNβяИксяИксJзнак равноβ0+Σязнак равно1,я≠JNβяИкся X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i Значения сохраняются для каждой из регрессий, а …

1
Fit GARCH (1,1) - модель с ковариатами в R
У меня есть некоторый опыт моделирования временных рядов, в виде простых моделей ARIMA и так далее. Теперь у меня есть некоторые данные, которые показывают кластеризацию волатильности, и я хотел бы попытаться начать с подгонки модели GARCH (1,1) к данным. У меня есть ряд данных и ряд переменных, которые, я думаю, …
10 r  regression  garch 

3
Когда прекратить байесовский тест А / Б?
Я пытаюсь провести A / B-тестирование байесовским способом, как в вероятностном программировании для хакеров и байесовских A / B-тестов . В обеих статьях предполагается, что лицо, принимающее решение, решает, какой из вариантов лучше, основываясь исключительно на вероятности какого-либо критерия, например, , поэтому лучше. Эта вероятность не дает никакой информации о …

2
Можно ли использовать итерации MCMC после прожига для оценки плотности?
После записи можно ли напрямую использовать итерации MCMC для оценки плотности, например, путем построения гистограммы или оценки плотности ядра? Меня беспокоит то, что итерации MCMC не обязательно независимы, хотя в большинстве случаев они распределены одинаково. Что если мы дополнительно применим прореживание к итерациям MCMC? Меня беспокоит то, что итерации MCMC …

1
Разъяснение в информационной геометрии
Этот вопрос связан с работой Амари « Дифференциальная геометрия изогнутых экспоненциальных семейств-искривлений и потеря информации ». Текст выглядит следующим образом. Пусть - n- мерное многообразие распределений вероятностей с системой координат θ = ( θ 1 , … , θ n ) , где предполагается , что p θ ( x …

1
Визуализация многих искаженных распределений
У меня есть серия дистрибутивов с левосторонним и тяжелым хвостом, которые я хотел бы показать. Есть 42 распределения через три фактора (помечено как A, Bи Cниже). Кроме того, изменение сокращается через фактор B. У меня проблема в том, что распределение трудно дифференцировать по шкале результата (соотношение или кратное изменение): Регистрация …

4
Почему нельзя делать корреляцию Пирсона по данным о пропорциях?
Онлайн модуль, который я изучаю, утверждает, что никогда не следует использовать корреляцию Пирсона с данными о пропорциях. Почему бы нет? Или, если это иногда хорошо или всегда хорошо, почему?

2
Одинаковые или разные? Байесовский путь
Скажем, у меня есть следующая модель: Poisson(λ)∼{λ1λ2if t<τif t≥τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} И я делаю выводы из и \ lambda_2, показанных ниже, из моих данных. Есть ли байесовский способ сказать (или количественной оценку) …

1
Нотация для многоуровневого моделирования
Формула, которую нужно указать для обучения многоуровневой модели (используя lmerиз lme4 Rбиблиотеки), всегда меня заводит. Я прочитал бесчисленные учебники и учебные пособия, но никогда не понимал это правильно. Итак, вот пример из этого урока, который я хотел бы видеть сформулированным в уравнении. Мы пытаемся смоделировать частоту голоса как функцию пола …

2
Превосходство LASSO над прямым выбором / обратным устранением с точки зрения ошибки прогнозирования перекрестной проверки модели
Я получил три уменьшенные модели из оригинальной полной модели, используя выбор вперед устранение в обратном направлении Техника наказания L1 (LASSO) Для моделей, полученных с использованием прямого выбора / обратного исключения, я получил перекрестную валидацию оценки ошибки прогнозирования, используя CVlmпакет, DAAGдоступный в R. Для модели, выбранной через LASSO, я использовал cv.glm. …

1
Квантильная формула оценки регрессии
Я видел два разных представления оценки квантильной регрессии, которые Q ( βQ) = ∑я : уя≥ х'яβNQ∣ уя- х'яβQ∣ + ∑я : уя&lt; х'яβN( 1 - д) ∣ уя- х'яβQ|Q(βq)=∑i:yi≥xi′βnq∣yi−xi′βq∣+∑i:yi&lt;xi′βn(1−q)∣yi−xi′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid и Q …

1
Как интерпретировать тест Кохрана-Мантеля-Хензеля?
Я проверяю независимость двух переменных, A и B, стратифицированных по C. A и B являются двоичными переменными, а C является категориальным (5 значений). Выполняя точный тест Фишера для A и B (все слои объединены), я получаю: ## (B) ## (A) FALSE TRUE ## FALSE 1841 85 ## TRUE 915 74 …

4
Прогнозирование временных рядов R с помощью нейронной сети, auto.arima и т. Д.
Я немного слышал об использовании нейронных сетей для прогнозирования временных рядов. Как я могу сравнить, какой метод для прогнозирования моих временных рядов (ежедневные данные о розничных продажах) лучше: auto.arima (x), ets (x) или nnetar (x). Я могу сравнить auto.arima с ETS по AIC или BIC. Но как я могу сравнить …

1
Оцениваете производительность регрессионной модели с использованием обучающих и тестовых наборов?
Я часто слышу об оценке эффективности модели классификации, проводя тестовый набор и обучая модель на тренировочном наборе. Затем создаем 2 вектора, один для прогнозируемых значений и один для истинных значений. Очевидно, что сравнение позволяет судить о производительности модели по ее прогнозирующей способности, используя такие вещи, как F-Score, Kappa Statistic, Precision …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.