Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Выбор параметра сложности в CART
В подпрограмме rpart () для создания моделей CART вы указываете параметр сложности, к которому вы хотите удалить свое дерево. Я видел две разные рекомендации по выбору параметра сложности: Выберите параметр сложности, связанный с минимально возможной перекрестной проверкой ошибки. Этот метод рекомендуется Quick-R и HSAUR. Выберите параметр наибольшей сложности, оценочная перекрестная …
16 r  cart  rpart 

2
Какие предыдущие распределения можно / нужно использовать для дисперсии в иерархической байесовской модели, когда средняя дисперсия представляет интерес?
В своей широко цитируемой статье априорные распределения для параметров дисперсии в иерархических моделях (916 цитата на Google Scholar) Гельман предлагает, что хорошими неинформативными априорными распределениями для дисперсии в иерархической байесовской модели являются равномерное распределение и половинное распределение. Если я правильно понимаю, это работает хорошо, когда параметр местоположения (например, среднее значение) …

4
Низкая точность классификации, что делать дальше?
Итак, я новичок в области ОД и пытаюсь провести некоторую классификацию. Моя цель - предсказать исход спортивного события. Я собрал некоторые исторические данные и сейчас пытаюсь обучить классификатор. Я получил около 1200 сэмплов, 0,2 из которых я разделил для целей тестирования, другие я включил в поиск по сетке (включая перекрестную …

3
Необязательные правила остановки не в учебниках
Правила остановки влияют на связь между P-значениями и частотой ошибок, связанных с решениями. Недавняя статья Simmons et al. В 2011 году термин « степени свободы исследователей» обозначает группу поведений, которые, по их мнению, являются ответственными за многие сообщения в литературе по психологии, которые были признаны не воспроизводимыми. Из этого поведения …

2
Какие процессы могут генерировать распределенные по Лапласу (двойные экспоненциальные) данные или параметры?
У многих дистрибутивов есть «мифы происхождения» или примеры физических процессов, которые они хорошо описывают: Вы можете получить нормально распределенные данные из сумм некоррелированных ошибок через центральную предельную теорему Вы можете получить биномиально распределенные данные из независимых подбрасываний монет или распределений Пуассона из предела этого процесса Вы можете получить экспоненциально распределенные …

4
Обрамление отрицательного биномиального распределения для секвенирования ДНК
Отрицательное биномиальное распределение стало популярной моделью для подсчета данных (в частности, ожидаемое количество считываний секвенирования в пределах данной области генома из данного эксперимента) в биоинформатике. Объяснения различаются: Некоторые объясняют это как то, что работает как распределение Пуассона, но имеет дополнительный параметр, предоставляющий больше свободы для моделирования истинного распределения с дисперсией, …

3
Пуассон является экспоненциальным, как Гамма-Пуассон к чему?
Распределение Пуассона может измерять события в единицу времени, а параметр равен λλ\lambda . Экспоненциальное распределение измеряет время до следующего события с параметром 1λ1λ\frac{1}{\lambda} . Можно преобразовать одно распределение в другое, в зависимости от того, проще ли моделировать события или время. Теперь гамма-пуассон - это «растянутый» пуассон с большей дисперсией. Распределение …

1
Как симулировать из гауссовой связки?
Предположим, что у меня есть два одномерных маргинальных распределения, скажем, FFF и GGG , из которых я могу смоделировать. Теперь построим их совместное распределение, используя гауссову связку , обозначаемую C(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) . Все параметры известны. Есть ли не-MCMC метод для симуляции из этой связки?

3
Непредвзятая оценка медианы
Предположим, у нас есть случайная переменная поддерживаемая на [ 0 , 1 ], из которой мы можем извлечь образцы. Как мы можем придумать объективную оценку медианы XXXX[0,1][0,1][0,1]XXX ? Конечно, мы можем сгенерировать несколько образцов и взять их медиану, но я понимаю, что в целом это не будет беспристрастным. Примечание: этот …
16 sampling 

3
Оценка вероятностей марковских переходов по данным последовательности
У меня есть полный набор последовательностей (432 наблюдения, если быть точным) из 4 состояний : например,A−DA−DA-D Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) РЕДАКТИРОВАТЬ : …

1
Смешанная модель и объединение стандартных ошибок для многосайтовых исследований. Почему смешанная модель намного эффективнее?
У меня есть набор данных, состоящий из серии ежемесячных подсчетов случаев «сломанной палки» с нескольких сайтов. Я пытаюсь получить единую сводную оценку из двух разных методов: Техника 1: Установите «сломанную палку» с Poisson GLM с переменной индикатора 0/1 и используя переменную времени и времени ^ 2 для контроля трендов во …

1
Определение и сходимость итеративно переоцененных наименьших квадратов
Я использовал итеративно переоцененные наименьшие квадраты (IRLS), чтобы минимизировать функции следующей формы, J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) где NNN - количество экземпляров xi∈Rxi∈Rx_i \in \mathbb{R} , m∈Rm∈Rm \in \mathbb{R} - надежная оценка, которую я хочу, а ρρ\rho - подходящая робастная штрафная функция. Допустим, он выпуклый (хотя …

3
Что значит Тета?
Я новичок в статистике и нашел это . В статистике θ, строчная греческая буква 'theta', является обычным именем для (вектора) параметра (ов) некоторого общего распределения вероятностей. Распространенной проблемой является поиск значения (й) тэты. Обратите внимание, что нет никакого смысла в именовании параметра таким образом. Мы могли бы также назвать это …

1
Ожидаемое значение лог-определителя матрицы Вишарта
Пусть , т.е. распределяется по мерному распределению Вишарта со средними и степенями свободы \ nu . Я хотел бы выражение для E (\ log | \ Lambda |), где | \ Lambda | это определитель.D × D ν Ψ ν E ( log | Λ | ) | Λ |Λ∼WD(ν,Ψ)Λ∼WD(ν,Ψ)\Lambda …

1
Выражение в замкнутой форме для квантилей
У меня есть две случайные величины, αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2 гдеU(0,1)U(0,1)U(0,1) - равномерное распределение 0-1. Затем они дают процесс, скажем: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) Теперь мне было интересно, существует ли выражение для замкнутой формы для теоретического 75-процентного квантиля P ( x ) для данного x ∈ ( 0 , 2 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.