Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Почему скорректированный R-квадрат меньше, чем R-квадрат, если скорректированный R-квадрат лучше предсказывает модель?
Насколько я понимаю, объясняет, насколько хорошо модель предсказывает наблюдение. Скорректированный - это тот, который учитывает больше наблюдений (или степеней свободы). Итак, Скорректированный предсказывает модель лучше? Тогда почему это меньше, чем ? Похоже, что часто должно быть больше.R2R2R^2R2R2R^2R2R2R^2R2R2R^2

3
Модель Кокса против логистической регрессии
Допустим, нам дали следующую проблему: Предскажите, какие клиенты, скорее всего, прекратят покупки в нашем магазине в ближайшие 3 месяца. Для каждого клиента мы знаем месяц, когда он начал покупать в нашем магазине, и, кроме того, у нас есть много поведенческих особенностей в ежемесячных агрегатах. «Старший» клиент покупал в течение пятидесяти …

1
Какие статистические методы являются архаичными и должны быть исключены из учебников? [закрыто]
В настоящее время этот вопрос не очень подходит для нашего формата вопросов и ответов. Мы ожидаем, что ответы будут подтверждены фактами, ссылками или опытом, но этот вопрос, скорее всего, вызовет дебаты, споры, опрос или расширенное обсуждение. Если вы считаете, что этот вопрос можно улучшить и, возможно, вновь открыть, обратитесь за …

1
Как ggplot вычисляет доверительные интервалы для регрессий?
Пакет построения графиков R ggplot2 имеет потрясающую функцию stat_smooth для построения линии регрессии (или кривой) с соответствующей доверительной полосой. Однако мне трудно понять, как именно генерируется этот доверительный интервал для каждого времени линии регрессии (или «метода»). Как я могу найти эту информацию?

1
Могу ли я преобразовать ковариационную матрицу в неопределенности для переменных?
У меня есть блок GPS, который выводит измерение шума через ковариационную матрицу ΣΣ\Sigma : Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (там же TTt участие , но давайте игнорировать , что ни на секунду.) Предположим, я …

2
Оценка ковариационного апостериорного распределения многомерного гауссова
Мне нужно «изучить» распределение двумерного гауссиана с несколькими выборками, но хорошая гипотеза о предыдущем распределении, поэтому я хотел бы использовать байесовский подход. Я определил свой предыдущий: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ …

1
Как оценить пуассоновский процесс с помощью R? (Или: как использовать пакет NHPoisson?)
У меня есть база данных событий (то есть переменная дат) и связанных ковариат. События генерируются нестационарным пуассоновским процессом с параметром, являющимся неизвестной (но, возможно, линейной) функцией некоторых ковариат. Я думаю, что пакет NHPoisson существует только для этой цели; но после 15 часов безуспешных исследований мне все еще далеко не узнать, …

2
Оценка параметров нормального распределения: медиана вместо среднего?
Общий подход для оценки параметров нормального распределения заключается в использовании среднего значения и стандартного отклонения / дисперсии выборки. Однако, если есть некоторые выбросы, медиана и срединное отклонение от медианы должны быть намного более устойчивыми, верно? На некоторых наборах данных я пытался, нормальное распределение , оцененное N(median(x),median|x−median(x)|)N(median(x),median|x−median(x)|)\mathcal{N}(\text{median}(x), \text{median}|x - \text{median}(x)|) , …

4
Всегда ли функция logit лучше всего подходит для регрессионного моделирования двоичных данных?
Я думал об этой проблеме. Обычная логистическая функция для моделирования двоичных данных: Но является ли функция логита, которая представляет собой S-образную кривую, всегда наилучшей для моделирования данных? Возможно, у вас есть основания полагать, что ваши данные не соответствуют нормальной S-образной кривой, а имеют другой тип кривой с областью(0,1).log(p1−p)=β0+β1X1+β2X2+…log⁡(p1−p)=β0+β1X1+β2X2+… \log\left(\frac{p}{1-p}\right)=\beta_0+\beta_1X_1+\beta_2X_2+\ldots (0,1)(0,1)(0,1) …

1
Значение выходных терминов в пакете gbm?
Я использую пакет gbm для классификации. Как и следовало ожидать, результаты хорошие. Но я пытаюсь понять вывод классификатора. В выводе пять терминов. `Iter TrainDeviance ValidDeviance StepSize Improve` Может ли кто-нибудь объяснить значение каждого термина, особенно значение улучшения .

2
Определение ковариационной структуры: плюсы и минусы
Каковы преимущества указания ковариационной структуры в GLM (вместо того, чтобы рассматривать все недиагональные элементы в ковариационной матрице как ноль)? Помимо отражения того, что каждый знает о данных, делает это улучшить качество посадки? повысить точность прогнозирования на удерживаемых данных? Позвольте нам оценить степень ковариации? Каковы затраты на навязывание ковариационной структуры? Является …

1
Почему мы стабилизируем дисперсию?
Я столкнулся с преобразованием, стабилизирующим дисперсию, когда читал метод Kaggle Essay Eval . Они используют преобразование стабилизации дисперсии для преобразования значений каппа, прежде чем взять их среднее значение, а затем преобразовать их обратно. Даже после прочтения вики о преобразованиях, стабилизирующих дисперсию, я не могу понять, почему мы на самом деле …

3
Зачем использовать определенную меру ошибки прогноза (например, MAD), а не другую (например, MSE)?
MAD = среднее абсолютное отклонение MSE = средняя квадратическая ошибка Я видел предложения из разных мест о том, что MSE используется, несмотря на некоторые нежелательные качества (например, http://www.stat.nus.edu.sg/~staxyc/T12.pdf , где говорится на стр. 8). Обычно считается, что MAD является лучшим критерием, чем MSE. Однако математически MSE удобнее, чем MAD. ") …
15 forecasting  error  mse  mae 

1
Визуализация результатов смешанной модели
Одна из проблем, с которыми я всегда сталкивался при работе со смешанными моделями, это выяснение визуализаций данных - таких, которые могут оказаться на бумаге или плакате, - как только кто-то получит результаты. Сейчас я работаю над моделью смешанных эффектов Пуассона с формулой, которая выглядит примерно так: a <- glmer(counts ~ …

7
Случайный лес переоснащается
Я пытаюсь использовать случайную лесную регрессию в scikits-learn. Проблема в том, что я получаю очень высокую ошибку теста: train MSE, 4.64, test MSE: 252.25. Вот как выглядят мои данные: (синий: реальные данные, зеленый: прогноз): Я использую 90% для обучения и 10% для тестирования. Это код, который я использую после попытки …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.