Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Семейство GLM представляет собой распределение переменной ответа или остатков?
Я обсуждал это с несколькими сотрудниками лаборатории, и мы обратились к нескольким источникам, но до сих пор не получили ответа: Когда мы говорим, что у GLM есть семейство пуассонов , скажем, мы говорим о распределении остатков или переменной отклика? Спорные вопросы Читая эту статью, она утверждает, что допущения GLM - …

1
В Случайном Лесу, почему случайное подмножество объектов выбрано на уровне узла, а не на уровне дерева?
Мой вопрос: почему случайный лес учитывает случайные подмножества объектов для разбиения на уровне узла в каждом дереве, а не на уровне дерева ? Справочная информация: это вопрос истории. Тин Кам Хо опубликовал эту статью о построении «лесов принятия решений» путем случайного выбора подмножества объектов, которые будут использоваться для выращивания каждого …

1
Является ли точность неправильным правилом оценки в бинарной классификации?
Недавно я узнал о правильных правилах оценки вероятностных классификаторов. Несколько потоков на этом сайте подчеркивали, что точность является неправильным правилом оценки и не должна использоваться для оценки качества прогнозов, генерируемых вероятностной моделью, такой как логистическая регрессия. Тем не менее, довольно много научных статей, которые я читал, приводили потерю из-за неправильной …

2
Есть ли теоретическая проблема с усреднением коэффициентов регрессии для построения модели?
Я хочу построить регрессионную модель, которая представляет собой среднее из нескольких моделей OLS, каждая из которых основана на подмножестве полных данных. Идея, лежащая в основе этого, основана на этой статье . Я создаю k сгибов и строю k моделей OLS, каждая на основе данных без одного сгиба. Затем я усредняю …

11
Стандартное отклонение совершенно неверно? Как вы можете рассчитать стандартное отклонение для высоты, количества и т. Д. (Положительные числа)?
Допустим, я вычисляю высоту (в см), и числа должны быть больше нуля. Вот пример списка: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 В этом примере, согласно нормальному распределению, 99,7% значений должны быть в ± 3 раза больше стандартного отклонения от среднего. Однако даже …

1
Интуитивное понимание теоремы Халмоса-Сэвиджа
Теорема Халмоса-Сэвиджа говорит, что для доминирующей статистической модели статистика достаточно, если (и только если) для всех существует -измеримая версия производной Радона Никодима где является привилегированный мера такая , что для и .(Ω,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P)T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A'){P∈P}{P∈P}\{P \in \mathscr{P} \} TTTdPdP∗dPdP∗\frac{dP}{dP*}dP∗dP∗dP*P∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty P_i c_i ci>0,∑∞i=1ci=1ci>0,∑i=1∞ci=1c_i …

1
Различные типы ковариации для гауссовых моделей смесей
При попытке гауссовой смеси Модели здесь , я нашел эти 4 типа ковариаций. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). Я много …

1
Формат ввода ответа в биномиальном glm в R
В России Rсуществует три метода форматирования входных данных для логистической регрессии с использованием glmфункции: Данные могут быть в «двоичном» формате для каждого наблюдения (например, y = 0 или 1 для каждого наблюдения); Данные могут быть в формате «Уилкинсон-Роджерс» (например, y = cbind(success, failure)), где каждая строка представляет одну обработку; или …

2
Почему RNN с блоками LSTM также могут страдать от «взрывных градиентов»?
У меня есть базовые знания о том, как работают RNN (и, в частности, с блоками LSTM). У меня есть графическое представление об архитектуре модуля LSTM, то есть ячейки и нескольких шлюзов, которые регулируют поток значений. Однако, по-видимому, я не до конца понял, как LSTM решает проблему «исчезающих и взрывающихся градиентов», …

5
Почему градиентный спуск неэффективен для большого набора данных?
Допустим, наш набор данных содержит 1 миллион примеров, то есть , и мы хотим использовать градиентный спуск, чтобы выполнить логистическую или линейную регрессию для этого набора данных.Икс1, … , Х106x1,…,x106x_1, \ldots, x_{10^6} Что с методом градиентного спуска делает его неэффективным? Напомним, что шаг градиентного спуска в момент времени определяется как:Ttt …

3
Понимание MCMC: какой будет альтернатива?
Изучение байесовской статистики в первый раз; как угол к пониманию MCMC я задавался вопросом: делает ли он что-то, что принципиально не может быть сделано по-другому, или это просто делает что-то гораздо более эффективное, чем альтернативы? В качестве иллюстрации предположим, что мы пытаемся вычислить вероятность наших параметров с учетом данных учетом …
13 bayesian  mcmc 

2
Как рассчитывается метод сходства в SpaCy?
Не уверен, что это правильный сайт стека, но здесь идет. Как работает метод .similiarity? Wow spaCy это здорово! Его модель tfidf может быть проще, но w2v только с одной строкой кода ?! В своем 10-строчном уроке по spaCy andrazhribernik показывает нам метод сходства, который можно использовать для токенов, отправлений, кусков …

4
Если каждый нейрон в нейронной сети в основном является функцией логистической регрессии, почему многослойность лучше?
Я прохожу курс DeepAI в Cousera (Неделя 3, видео 1 «Обзор нейронных сетей»), и Эндрю Нг объясняет, как каждый слой в нейронной сети - просто очередная логистическая регрессия, но он не объясняет, как это делает вещь более точной. Итак, в двухслойной сети, как многократный расчет логистики делает его более точным?

1
Почему наивный байесовский классификатор оптимален для проигрыша 0-1?
Наивный байесовский классификатор - это классификатор, который назначает элементы xxx классу CCC на основе максимизации апостериорного P(C|x)P(C|x)P(C|x) для членства в классе и предполагает, что характеристики элементов независимы. Потеря 0-1 - это потеря, которая присваивает любой ошибочной классификации потерю «1», а потерю «0» - любой правильной классификации. Я часто читаю (1), …

1
Почему на практике не используется алгоритм спуска «без седловых ньютонов»?
Недавно я прочитал статью Yann Dauphin et al. Выявление и устранение проблемы седловой точки в многомерной невыпуклой оптимизации , где они вводят интересный алгоритм спуска, называемый Ньютоном без седла , который, похоже, специально предназначен для оптимизации нейронной сети и не должен страдать от застревания в седловых точках. как методы первого …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.