Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
«Полу-контролируемое обучение» - это переобучение?
Я читал отчет о победившем решении конкурса Kaggle ( Malware Classification ). Отчет можно найти в этом сообщении на форуме . Эта проблема была проблемой классификации (девять классов, метрика - логарифмическая потеря) с 10000 элементами в наборе поездов, 10000 элементов в наборе испытаний. Во время конкурса модели оценивались по сравнению …

3
Как предсказать результат только с положительными случаями в качестве обучения?
Ради простоты, скажем, я работаю над классическим примером писем со спамом / без спама. У меня есть набор из 20000 писем. Из них я знаю, что 2000 являются спамом, но у меня нет примеров писем, не являющихся спамом. Я хотел бы предсказать, являются ли оставшиеся 18000 спамом или нет. В …

1
Bootstrapping vs Bayesian Bootstrapping концептуально?
У меня проблемы с пониманием, что такое байесовский процесс начальной загрузки, и чем он отличается от вашей обычной начальной загрузки. И если бы кто-то мог предложить интуитивно-концептуальный обзор и сравнение того и другого, это было бы здорово. Давайте возьмем пример. Скажем, у нас есть набор данных X, который [1,2,5,7,3]. Если …

2
покрытие доверительных интервалов регуляризованными оценками
Предположим, я пытаюсь оценить большое количество параметров по многомерным данным, используя некие регуляризованные оценки. Регуляризатор вносит некоторую погрешность в оценки, но это все же может быть хорошим компромиссом, потому что уменьшение дисперсии должно более чем компенсировать это. Проблема возникает, когда я хочу оценить доверительные интервалы (например, используя приближение Лапласа или …

2
Добавление весов к логистической регрессии для несбалансированных данных
Я хочу смоделировать логистическую регрессию с несбалансированными данными (9: 1). Я хотел попробовать опцию весов в glmфункции в R, но я не уверен на 100%, что она делает. Допустим , моя переменная выход c(0,0,0,0,0,0,0,0,0,1). Теперь я хочу дать «1» в 10 раз больше веса. поэтому я даю весовой аргумент weights=c(1,1,1,1,1,1,1,1,1,1,1,10). …

2
Методы увеличения данных для общих наборов данных?
Во многих приложениях машинного обучения так называемые методы дополнения данных позволили построить лучшие модели. Например, предположим, тренировочный набор из изображений кошек и собак. Вращением, зеркальным отображением, регулировкой контрастности и т. Д. Можно создавать дополнительные изображения из исходных.100100100 В случае изображений увеличение данных является относительно простым. Однако предположим (например), что у …

1
Когда использовать данные Пуассона против геометрических и отрицательных биномиальных GLM для данных подсчета?
Я пытаюсь сделать макет для себя, когда уместно использовать тип регрессии (геометрический, пуассоновский, отрицательный бином) с данными счета в рамках GLM (только 3 из 8 распределений GLM используются для данных счета, хотя большая часть того, что Я читал центры вокруг отрицательных биномиальных и пуассоновских распределений). Когда использовать данные Пуассона против …

1
Я только что изобрел байесовский метод для анализа кривых ROC?
преамбула Это длинный пост. Если вы перечитываете это, обратите внимание, что я пересмотрел часть вопроса, хотя исходные материалы остались прежними. Кроме того, я считаю, что разработал решение проблемы. Это решение появляется в нижней части поста. Спасибо CliffAB за то, что он указал, что мое оригинальное решение (отредактировано из этого поста; …

2
Почему нормальность остатков «едва важна вообще» для оценки линии регрессии?
Гельман и Хилл (2006) пишут на стр. 46, что: Предположение регрессии, которое обычно наименее важно, состоит в том, что ошибки обычно распределяются. Фактически, для оценки линии регрессии (по сравнению с прогнозированием отдельных точек данных) предположение о нормальности едва ли вообще важно. Таким образом, в отличие от многих учебников по регрессии, …

2
У этого дискретного распределения есть имя?
У этого дискретного распределения есть имя? Для i∈1...Ni∈1...Ni \in 1...N f(i)=1N∑Nj=i1jf(i)=1N∑j=iN1jf(i) = \frac{1}{N} \sum_{j = i}^N \frac{1}{j} Я наткнулся на этот дистрибутив из следующего: У меня есть список из элементов, ранжированных по какой-либо служебной функции. Я хочу случайным образом выбрать один из элементов, смещаясь к началу списка. Итак, сначала я …

1
интерпретация оценок логистической регрессии клоглога
Может ли кто-нибудь посоветовать мне, как интерпретировать оценки из логистической регрессии, используя ссылку на клоглог? Я установил следующую модель в lme4: glm(cbind(dead, live) ~ time + factor(temp) * biomass, data=mussel, family=binomial(link=cloglog)) Например, оценка времени составляет 0,015. Правильно ли говорить, что шансы смертности в единицу времени умножаются на exp (0,015) = …

2
Каковы основные различия между принципами причинности Грейнджер и Перл?
Недавно я наткнулся на несколько статей и онлайн-ресурсов, в которых упоминается причинность Грейнджер . Краткий просмотр соответствующей статьи в Википедии оставил у меня впечатление, что этот термин относится к причинности в контексте временных рядов (или, в более общем случае, случайных процессов ). Более того, чтение этого красивого поста в блоге …

3
Распределение наибольшего фрагмента сломанной палки (промежутки)
Пусть палка длиной 1 разбита на k+1k+1k+1 фрагменты равномерно случайным образом. Каково распределение длины самого длинного фрагмента? Более формально, пусть (U1,…Uk)(U1,…Uk)(U_1, \ldots U_k) будет IID U(0,1)U(0,1)U(0,1) , и (U(1),…,U(k))(U(1),…,U(k))(U_{(1)}, \ldots, U_{(k)}) будет ассоциированная статистика порядка, т.е. мы просто упорядочим выборку в таком виде таким образом, что U(1)≤U(2)≤,…,≤U(k)U(1)≤U(2)≤,…,≤U(k)U_{(1)} \leq U_{(2)} \leq, …

2
R-квадрат в квантильной регрессии
Я использую квантильную регрессию, чтобы найти предикторы 90-го процентиля моих данных. Я делаю это в R, используя quantregпакет. Как я могу определить для квантильной регрессии, которая укажет, насколько изменчивость объясняется переменными предиктора?r2r2r^2 Что я действительно хочу знать: «Любой метод, который я могу использовать, чтобы найти, сколько изменчивости объясняется?». Уровни значимости …

1
Когда средняя статистика является достаточной статистикой?
Я натолкнулся на замечание в The Chemical Statistician, что выборочная медиана часто может быть выбором для достаточной статистики, но, помимо очевидного случая одного или двух наблюдений, когда он равен среднему значению выборки, я не могу думать о другой нетривиальной случай, когда выборка медиана достаточно.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.