Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
10-кратная перекрестная проверка по сравнению с перекрестной проверкой с пропуском одного
Я делаю вложенную перекрестную проверку. Я читал, что перекрестная проверка без участия может быть предвзятой (не помню почему). Лучше ли использовать 10-кратную перекрестную проверку или перекрестную проверку по принципу «один-один-выход», кроме более продолжительного времени выполнения перекрестной проверки «один-один-выход»?

4
Какую проблему решают передискретизация, недостаточная выборка и SMOTE?
В недавнем, хорошо полученном вопросе Тим спрашивает, когда несбалансированные данные действительно являются проблемой в машинном обучении ? Предпосылка вопроса заключается в том, что существует много литературы по машинному обучению, в которой обсуждается баланс классов и проблема несбалансированных классов . Идея состоит в том, что наборы данных с дисбалансом между положительным …

1
Насколько действителен эмпирический байесовский метод?
Поэтому я только что закончил читать замечательную книгу « Введение в эмпирический байесовский анализ» . Я думал, что книга была великолепной, но построение априорных данных на основе данных было неверным. Я был обучен тому, что вы разрабатываете план анализа, затем собираете данные и проверяете гипотезу, ранее определенную в плане анализа. …

2
Полезны ли смешанные модели в качестве прогностических моделей?
Я немного озадачен преимуществами смешанных моделей в отношении прогнозного моделирования. Поскольку прогнозирующие модели обычно предназначены для прогнозирования значений ранее неизвестных наблюдений, для меня кажется очевидным, что единственная возможность, с которой смешанная модель может быть полезной, заключается в ее способности предоставлять прогнозы на уровне популяции (то есть без добавления каких-либо случайных …

2
Квантильная регрессия: функция потери
Я пытаюсь понять квантильную регрессию, но одна вещь, которая заставляет меня страдать, это выбор функции потерь. ρτ(u)=u(τ−1{u&lt;0})ρτ(u)=u(τ−1{u&lt;0})\rho_\tau(u) = u(\tau-1_{\{u<0\}}) Я знаю, что минимум ожидания равен -квентилю, но какова интуитивная причина начинать с этой функции? Я не вижу связи между минимизацией этой функции и квантиля. Может кто-нибудь объяснить это мне?τ %ρτ(y−u)ρτ(y−u)\rho_\tau(y-u)τ%τ%\tau\%

2
Непрерывное обобщение отрицательного биномиального распределения
Отрицательное биномиальное (NB) распределение определяется на неотрицательных целых числах и имеет функцию вероятности массыИмеет ли смысл рассматривать непрерывное распределение на неотрицательных вещественных числах, определенных той же формулой (заменив k \ in \ mathbb N_0 на x \ in \ mathbb R _ {\ ge 0} )? Биномиальный коэффициент может быть …

1
Что такое вариационные автоэнкодеры и для каких задач обучения они используются?
Согласно этому и этому ответу, автоэнкодеры кажутся техникой, которая использует нейронные сети для уменьшения размеров. Я хотел бы дополнительно знать, что такое вариационный автоэнкодер (его основные отличия / преимущества по сравнению с «традиционными» автоэнкодерами), а также каковы основные задачи обучения, для которых используются эти алгоритмы.

2
Кто изобрел дерево решений?
Я пытаюсь отследить, кто изобрел структуру данных и алгоритм дерева решений. В статье в Википедии об изучении дерева решений есть утверждение, что «ID3 и CART были изобретены независимо примерно в одно и то же время (между 1970 и 1980 годами)». ID3 был представлен позже в: Quinlan, JR 1986. Индукция деревьев …
24 cart  history 

3
История неинформативной априорной теории
Я пишу короткое теоретическое эссе для курса Байесовской статистики (в магистратуре по экономике) на неинформативных приорах, и я пытаюсь понять, каковы этапы развития этой теории. К настоящему времени моя временная шкала состоит из трех основных этапов: принцип безразличия Лапласа (1812), неинвариантные априорные значения (Джеффрис (1946)), ссылка Бернардо до (1979). Из …

3
По какой причине Adam Optimizer считается устойчивым к значению своих гиперпараметров?
Я читал об оптимизаторе Адама для Deep Learning и натолкнулся на следующее предложение в новой книге « Deep Learning » Бенджо, Гудфеллоу и Курвилля: Адам, как правило, считается достаточно устойчивым к выбору гиперпараметров, хотя скорость обучения иногда необходимо изменить по сравнению с предложенным значением по умолчанию. если это правда, то …

1
Каковы свойства распределения полу Коши?
В настоящее время я работаю над проблемой, в которой мне нужно разработать алгоритм Монте-Карло с цепью Маркова (MCMC) для модели пространства состояний. Чтобы решить проблему, мне была дана следующая вероятность : p ( τ ) = 2I ( τ &gt; 0) / (1+ τ 2 ). τ - стандартное отклонениеττ\tauττ\tauττ\tauτ2τ2\tau^2ττ\tau …

3
Что можно сделать вывод о данных, когда среднее арифметическое очень близко к среднему геометрическому?
Есть ли что-то существенное в среднем геометрическом и среднем арифметическом значении, которое находится очень близко друг к другу, скажем, ~ 0,1%? Какие предположения можно сделать о таком наборе данных? Я работал над анализом набора данных и заметил, что по иронии судьбы значения очень и очень близки. Не точно, но близко. …

1
Расчет предельной вероятности по образцам MCMC
Это повторяющийся вопрос (см. Этот пост , этот пост и этот пост ), но у меня другое вращение. Предположим, у меня есть набор сэмплов из стандартного сэмплера MCMC. Для каждого образца я знаю значение вероятности записи в журнал и предшествующего . Если это помогает, я также знаю значение вероятности записи …

7
Рекомендации для нетехнических, но глубоких статей в статистике
Источником вдохновения для этого вопроса послужила известная статья покойного Лео-Бреймана « Статистическое моделирование: две культуры» (доступен в открытом доступе). Автор сравнивает то, что он видит как два разных подхода к анализу данных, затрагивая ключевые идеи классической статистики и машинного обучения. Тем не менее, статья понятна широкой аудитории - возможно, любому, …
24 references 

2
Переключиться с моделирования процесса с использованием распределения Пуассона, чтобы использовать отрицательное биномиальное распределение?
\newcommand{\P}{\mathbb{P}} Мы имеем случайный процесс , который может или может-не-происходить несколько раз в течение заданного периода времени TTT . У нас есть поток данных из уже существующей модели этого процесса, который обеспечивает вероятность ряда событий, происходящих в период 0≤t&lt;T0≤t&lt;T0 \leq t < T . Эта существующая модель устарела, и нам …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.