Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как рассчитать вес критерия Фишера?
Я изучаю распознавание образов и машинное обучение, и я столкнулся со следующим вопросом. Рассмотрим задачу классификации двух классов с равной вероятностью предшествующего класса P(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} и распределение экземпляров в каждом классе, заданное p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} …

2
Когда использовать байесовские сети поверх других подходов машинного обучения?
Я ожидаю, что не может быть никакого определенного ответа на этот вопрос. Но в прошлом я использовал несколько алгоритмов машинного обучения и пытаюсь узнать о байесовских сетях. Я хотел бы понять, при каких обстоятельствах или для каких типов проблем вы бы выбрали использование байесовской сети по сравнению с другими подходами?

3
почему метод повышения чувствительности к выбросам
Я нашел много статей, в которых говорится, что методы повышения чувствительны к выбросам, но нет статей, объясняющих почему. По моему опыту, выбросы плохи для любого алгоритма машинного обучения, но почему методы повышения выделяются как особенно чувствительные? Как бы оценили следующие алгоритмы с точки зрения чувствительности к выбросам: буст-дерево, случайный лес, …

1
ANOVA: тестирование предположения о нормальности для многих групп с небольшим количеством образцов на группу
Предположим следующую ситуацию: у нас есть большое количество (например, 20) с небольшим размером группы (например, n = 3). Я заметил, что если я сгенерирую значения из равномерного распределения, остатки будут выглядеть примерно нормально, даже если распределение ошибок будет равномерным. Следующий код R демонстрирует это поведение: n.group = 200 n.per.group = …

2
Обеспечивает ли доверительный интервал меру неопределенности оценки параметра?
Я читал пост в блоге статистика Уильяма Бриггса, и следующее утверждение заинтересовало меня, если не сказать больше. Что вы об этом думаете? Что такое доверительный интервал? Конечно, это уравнение, которое предоставит вам интервал для ваших данных. Он предназначен для обеспечения меры неопределенности оценки параметра. Теперь, в строгом соответствии с теорией …

2
Когда MCMC полезен?
У меня возникли проблемы с пониманием, в какой ситуации подход MCMC действительно полезен. Я рассматриваю игрушечный пример из книги Крушке «Анализ байесовских данных: учебник по R и BUGS». До сих пор я понимал, что нам нужно целевое распределение, пропорциональное , чтобы иметь выборку . Однако, мне кажется, что как только …
12 mcmc 

2
Ридж наказал GLM, используя увеличение строки?
Я читал, что регрессия гребня может быть достигнута простым добавлением строк данных в исходную матрицу данных, где каждая строка создается с использованием 0 для зависимых переменных и квадратного корня из Кkk или нуля для независимых переменных. Затем добавляется одна дополнительная строка для каждой независимой переменной. Мне было интересно, можно ли …

3
Почему в классической статистике не используется метод удержания (разделение данных на обучение и тестирование)?
В моей классной работе по извлечению данных был предложен метод удержания для оценки производительности модели. Однако, когда я взял свой первый класс по линейным моделям, это не было введено как средство проверки или оценки модели. Мои онлайн-исследования также не показывают какого-либо пересечения. Почему метод удержания не используется в классической статистике?

1
К средних || aka Scalable K-Means ++
Бахман Бахмани и соавт. представил k-means ||, который является более быстрой версией k-means ++. Этот алгоритм взят из страницы 4 их работы , Бахмани Б., Мозли Б., Ваттани А., Кумар Р. и Васильвицкий С. (2012). Масштабируемое k-означает ++. Труды фонда VLDB , 5 (7), 622-633. К сожалению, я не понимаю …

3
Условная вероятность непрерывной переменной
Предположим, что случайная величина следует непрерывному равномерному распределению с параметрами 0 и 10 (т. Е. )U ∼ U ( 0 , 10 )UUUU∼ U ( 0 , 10 )U∼U(0,10)U \sim \rm{U}(0,10) Теперь давайте обозначим A событие, когда = 5, а B событие, когда равно или 6. Согласно моему пониманию, оба …


1
Шахматисты мужского и женского пола - ожидаемые расхождения в хвостах раздач
Я заинтересован в выводах этой статьи за 2009 год: Почему (лучшие) женщины так хороши в шахматах? Уровень участия и гендерные различия в интеллектуальных сферах В этой статье делается попытка объяснить, почему самые лучшие шахматисты выглядят намного лучше, чем самые лучшие игроки женского пола (женщины составляют всего 2% из 1000 лучших …

1
Существуют ли современные способы использования джекнифинга?
Вопрос: Bootstrapping превосходит джекнифинг; однако мне интересно, есть ли случаи, когда джекнифинг является единственным или, по крайней мере, жизнеспособным вариантом для характеристики неопределенности из оценок параметров. Кроме того, в практических ситуациях, насколько предвзятый / неточный джекнифинг по сравнению с начальной загрузкой, и могут ли результаты ножевого ножа обеспечить предварительное понимание …

1
Сверхдисперсность и моделирование в пуассоновских моделях случайных эффектов со смещениями
Я столкнулся с рядом практических вопросов при моделировании данных подсчета из экспериментальных исследований с использованием эксперимента внутри объекта. Я кратко опишу эксперимент, данные и то, что я уже сделал, а затем мои вопросы. Четыре различных фильма были показаны выборке респондентов в последовательности. После каждого фильма проводилось интервью, в котором мы …

1
Оптимизатор lme4 по умолчанию требует много итераций для многомерных данных
TL; DR: lme4оптимизация кажется линейной по количеству параметров модели по умолчанию и намного медленнее, чем эквивалентная glmмодель с фиктивными переменными для групп. Что я могу сделать, чтобы ускорить это? Я пытаюсь соответствовать довольно большой иерархической модели логита (~ 50 тыс. Строк, 100 столбцов, 50 групп). Подгонка нормальной модели логита к …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.