Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Простая линейная модель с автокоррелированными ошибками в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 8 месяцев назад . Как мне согласовать линейную модель с автокоррелированными ошибками в R? В stata я бы использовал praisкоманду, но я не могу …


1
Какие алгоритмы / методы MCMC используются для дискретных параметров?
Я знаю достаточно много о подборе непрерывных параметров, особенно градиентных методов, но не много о подборе дискретных параметров. Каковы обычно используемые алгоритмы / методы MCMC для подгонки дискретных параметров? Существуют ли алгоритмы, которые являются достаточно общими и достаточно мощными? Существуют ли алгоритмы, которые хорошо справляются с проклятием размерности? Например, я …
19 bayesian  mcmc 

3
Как сделать выборку из ?
Я хочу сделать выборку в соответствии с плотностью где и строго положительны. (Мотивация: это может быть полезно для выборки Гиббса, когда параметр формы гамма-плотности имеет одинаковый априор.)f(a)∝cada−1Γ(a)1(1,∞)(a)f(a)∝cada−1Γ(a)1(1,∞)(a) f(a) \propto \frac{c^a d^{a-1}}{\Gamma(a)} 1_{(1,\infty)}(a) cccddd Кто-нибудь знает, как легко сделать выборку из этой плотности? Может быть, это стандарт и просто то, о …

3
Является ли байесовская статистика подлинным улучшением по сравнению с традиционной (частой) статистикой поведенческих исследований?
Во время участия в конференциях сторонники байесовской статистики немного подталкивали к оценке результатов экспериментов. Он хвалится как более чувствительный, уместный и избирательный по отношению к подлинным результатам (меньше ложных срабатываний), чем статистика по частоте. Я немного изучил эту тему, и до сих пор меня не убеждают преимущества использования байесовской статистики. …

2
Когда сегодня важен «Ближайший сосед»?
В 1999 году Beyer et al. спросил, когда смысл "Ближайший сосед"? Существуют ли лучшие способы анализа и визуализации влияния плоскостности расстояний на поиск NN с 1999 года? Предоставляет ли [данный] набор данных значимые ответы на проблему 1-NN? Проблема 10-НН? Проблема 100-НН? Как бы вы, эксперты, подошли к этому вопросу сегодня? …


1
Интерпретация графиков анализа 2D соответствия
Я искал в интернете повсюду ... Мне еще предстоит найти действительно хороший обзор того, как интерпретировать 2D-графики анализа соответствия. Может ли кто-нибудь дать совет по интерпретации расстояний между точками? Возможно, пример поможет, вот график, который можно найти на многих веб-сайтах, которые я видел, где обсуждается анализ соответствия. Красные треугольники представляют …

7
Меры сложности модели
Как мы можем сравнить сложность двух моделей с одинаковым количеством параметров? Изменить 09/19 : Чтобы уточнить, сложность модели является мерой того, насколько трудно учиться на ограниченных данных. Когда две модели в равной степени соответствуют существующим данным, модель с меньшей сложностью даст меньшую ошибку в будущих данных. Когда используются аппроксимации, технически …

3
Как я могу рассчитать условную вероятность нескольких событий?
Не могли бы вы сообщить мне, пожалуйста, как я могу рассчитать условную вероятность нескольких событий? например: P (A | B, C, D) -? Я знаю это: P (A | B) = P (A B) / P (B)∩∩\cap Но, к сожалению, я не могу найти формулу, если событие A зависит от …

10
Ресурсы для обучения созданию визуализаций данных?
Мне интересно узнать, как создать тип визуализаций, которые вы видите на http://flowingdata.com, и информация прекрасна . РЕДАКТИРОВАТЬ: смысл, визуализации, которые интересны сами по себе - вроде как графика Нью-Йорк Таймс, в отличие от быстрого что-то для отчета. Какие инструменты используются для их создания - это в основном Adobe Illustrator / …

6
В чем разница между сбором данных и статистическим анализом?
В чем разница между сбором данных и статистическим анализом? Для некоторого фона мое статистическое образование было, я думаю, довольно традиционным. Поставлен конкретный вопрос, разработано исследование, собраны и проанализированы данные, чтобы дать некоторое представление об этом вопросе. В результате я всегда скептически относился к тому, что я считал «углублением данных», т. …

6
Какова «фундаментальная» идея машинного обучения для оценки параметров?
«Фундаментальная» идея статистики для оценки параметров - это максимальная вероятность . Мне интересно, какова соответствующая идея в машинном обучении. Qn 1. Было бы справедливо сказать, что «фундаментальная» идея в машинном обучении для оценки параметров: «Функции потери» [Примечание: у меня сложилось впечатление, что алгоритмы машинного обучения часто оптимизируют функцию потерь, и, …

1
Почему оценку Джеймса-Стейна называют оценкой «усадки»?
Я читал об оценке Джеймса-Стейна. В этих примечаниях определяется как θ^=(1−p−2∥X∥2)Xθ^=(1−p−2‖X‖2)X \hat{\theta}=\left(1 - \frac{p-2}{\|X\|^2}\right)X Я прочитал доказательство, но я не понимаю следующее утверждение: Геометрически оценка Джеймса – Стейна сжимает каждый компонент XXX направлении начала координат ... Что точно означает «сжимает каждый компонент XXX направлении источника»? Я думал о чем-то вроде …

2
Каково обоснование ковариационной функции Матерна?
Ковариационная функция Матерна обычно используется в качестве функции ядра в гауссовском процессе. Определяется так Cν(d)=σ221−νΓ(ν)(2ν−−√dρ)νKν(2ν−−√dρ)Cν(d)=σ221−νΓ(ν)(2νdρ)νKν(2νdρ) {\displaystyle C_{\nu }(d)=\sigma ^{2}{\frac {2^{1-\nu }}{\Gamma (\nu )}}{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}^{\nu }K_{\nu }{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}} где ddd - функция расстояния (например, евклидово расстояние), ΓΓ\Gamma - гамма-функция, KνKνK_\nu - …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.