Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
K-означает: сколько итераций в практических ситуациях?
У меня нет отраслевого опыта в области интеллектуального анализа данных или больших данных, поэтому я хотел бы услышать, как вы поделились своим опытом. Люди на самом деле используют k-means, PAM, CLARA и т. Д. В действительно большом наборе данных? Или они просто случайно выбирают из него образец? Если они просто …

3
Почему гамильтонова динамика лучше, чем предложение случайного блуждания в MCMC в некоторых случаях?
Гамильтонова динамика всегда превосходит случайное блуждание в алгоритме Метрополиса в некоторых случаях. Может ли кто-нибудь объяснить причину простыми словами без особой математики?
10 mcmc 

3
Функция потерь для семантической сегментации
Приносит свои извинения за неправильное использование технических терминов. Я работаю над проектом семантической сегментации с помощью сверточных нейронных сетей (CNN); пытаясь реализовать архитектуру типа Encoder-Decoder, поэтому размер вывода совпадает с размером ввода. Как вы оформляете этикетки? Какую функцию потерь следует применять? Особенно в ситуации тяжелого дисбаланса классов (но соотношение между …

2
Скорректированный индекс ранда против скорректированной взаимной информации
Я пытаюсь оценить производительность кластеризации. Я читал документацию skiscit-learn по метрикам . Я не понимаю разницы между ARI и AMI. Мне кажется, что они делают одно и то же двумя разными способами. Ссылаясь на документацию: Учитывая знание базовых назначений класса истинности label_true и наших алгоритмов кластеризации для одних и тех …

2
В моделях Normal и Binomial всегда задняя дисперсия меньше предыдущей дисперсии?
Или какие условия это гарантируют? В целом (и не только для нормальных и биномиальных моделей) я полагаю, что главная причина, которая нарушила это утверждение, состоит в том, что существует несоответствие между моделью выборки и предыдущей, но что еще? Я начинаю с этой темы, поэтому я очень ценю простые примеры

2
Центральная предельная теорема для цепей Маркова
\newcommand{\E}{\mathbb{E}}\newcommand{\P}{\mathbb{P}} Центральная предельная теорема (CLT) утверждает, что для X1,X2,…Икс1,Икс2,...X_1,X_2,\dots независимы и одинаково распределены (iid) с E[Xi]=0Е[Икся]знак равно0\E[X_i]=0 и Var(Xi)&lt;∞Var⁡(Икся)&lt;∞\operatorname{ Var} (X_i)<\infty , сумма сходится к нормальному распределению при n→∞N→∞n\to\infty : ∑i=1nXi→N(0,n−−√).Σязнак равно1NИкся→N(0,N), \sum_{i=1}^n X_i \to N\left(0, \sqrt{n}\right). Предположим вместо этого, что X1,X2,…Икс1,Икс2,...X_1,X_2,\dots образуют цепь Маркова с конечным состоянием со стационарным …

1
RNN с L2 Regularization перестает учиться
Я использую Двунаправленный RNN, чтобы обнаружить случай несбалансированного события. Положительный класс в 100 раз реже, чем отрицательный. Пока не используется регуляризация, я могу получить 100% точность в наборе поездов и 30% в наборе проверки. Я включаю регуляризацию l2, и в результате получается набор только для 30% точности набора поездов вместо …

1
Комплексный анализ, функциональный анализ для более глубокого понимания машинного обучения
Я хочу углубиться в машинное обучение (теория и применение в финансах). Я хочу спросить, насколько важны комплексный анализ и функциональный анализ в качестве основы для машинного обучения? Нужно ли изучать эти предметы или мне нужно сосредоточиться на другой теме (если да, то на какой?)

3
Расчет распределения от минимального, среднего и максимального
Предположим, у меня есть минимум, среднее значение и максимум некоторого набора данных, скажем, 10, 20 и 25. Есть ли способ: создать распределение из этих данных, и знать, какой процент населения, вероятно, лежит выше или ниже среднего Редактировать: Согласно предложению Глена, предположим, что у нас размер выборки 200.

4
Лучший способ заполнить N независимых генераторов случайных чисел от 1 значения
В моей программе мне нужно запустить N отдельных потоков, каждый с собственным RNG, который используется для выборки большого набора данных. Мне нужно иметь возможность заполнить весь этот процесс одним значением, чтобы я мог воспроизвести результаты. Достаточно ли просто последовательно увеличивать начальное число для каждого индекса? В настоящее время я использую …

2
Частое определение вероятности; существует ли формальное определение?
Существует ли какое-либо формальное (математическое) определение того, что понимают частые люди под «вероятностью». Я читал, что это относительная частота появления «в долгосрочной перспективе», но есть ли какой-то формальный способ определить это? Есть ли известные ссылки, где я могу найти это определение? РЕДАКТИРОВАТЬ: Под частым ответом (см. Комментарий @whuber и мои …

2
Проверка предположения о пропорциональной опасности в параметрических моделях
Мне известно о тестировании предположения о пропорциональной опасности в контексте моделей Кокса PH, но я не встречал ничего, связанного с параметрическими моделями? Есть ли реальный способ проверить предположение PH некоторых параметрических моделей? Кажется, что следует учитывать, что параметрические модели лишь немного отличаются от полупараметрических моделей Кокса? Например, если бы я …

1
Как рассчитать из выборки R в квадрате?
Я знаю, что это, вероятно, обсуждалось где-то еще, но я не смог найти четкого ответа. Я пытаюсь использовать формулу для расчета вне выборки R 2 модели линейной регрессии, где S S R - это сумма квадратов невязок, а S S T - это общая сумма квадратов. Для тренировочного набора ясно, …

2
Прогнозирование требований к памяти ЦП и ГП для обучения DNN
Скажем, у меня есть модель архитектуры глубокого обучения, а также выбранный размер мини-пакета. Как я могу извлечь из этих ожидаемых требований к памяти для обучения этой модели? В качестве примера рассмотрим (неповторяющуюся) модель с входом измерения 1000, 4 полностью подключенными скрытыми слоями измерения 100 и дополнительным выходным слоем измерения 10. …

3
Лучший способ оценить методы оценки PDF
Я хочу проверить некоторые из моих идей, которые, на мой взгляд, лучше, чем все, что я видел. Я могу ошибаться, но я хотел бы проверить свои идеи и побороть мои сомнения с помощью более определенных наблюдений. Я думал сделать следующее: Аналитически определить набор распределений. Некоторые из них простые, такие как …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.