Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Методы обработки неполных / отсутствующих данных
Мой вопрос направлен на методы работы с неполными данными во время обучения / подгонки классификатора / модели. Например, в наборе данных с несколькими сотнями строк, каждая строка, скажем, пять измерений и метка класса в качестве последнего элемента, большинство точек данных будут выглядеть так: [0,74, 0,39, 0,14, 0,33, 0,34, 0] Некоторые …

5
Что кривые ROC говорят вам, что традиционный вывод не будет?
Когда вы будете склонны использовать кривые ROC над некоторыми другими тестами, чтобы определить прогнозирующую способность какого-либо измерения результата? При работе с дискретными результатами (живыми / мертвыми, присутствующими / отсутствующими), что делает кривые ROC более или менее мощными, чем что-то вроде хи-квадрата?
12 regression  roc 

1
T-тест с двумя выборками с взвешенными данными
Я хочу выполнить T-тест с двумя выборками, чтобы проверить разницу между двумя независимыми выборками, каждая из которых соответствует предположениям T-теста (можно считать, что каждое распределение является независимым и идентично распределяется как Нормальное с равной дисперсией) , Единственное осложнение из основного T-критерия с двумя выборками состоит в том, что данные взвешены. …
12 t-test 

2
Статистический тест для таблиц сопряженности nxm
У меня есть набор данных, состоящий из элементов из трех групп, назовем их G1, G2 и G3. Я проанализировал некоторые характеристики этих элементов и разделил их на 3 типа «поведения»: T1, T2 и T3 (для этого я использовал кластерный анализ). Итак, теперь у меня есть таблица непредвиденных обстоятельств 3 x …

3
Точный тест Фишера с весами?
Кто-нибудь знает вариант точного теста Фишера, который учитывает вес? Например, веса выборки . Таким образом, вместо обычной кросс-таблицы 2x2 каждая точка данных имеет значение «масса» или «размер», взвешивающее точку. Пример данных: A B weight N N 1 N N 3 Y N 1 Y N 2 N Y 6 N …


3
Что такое совместная оценка?
У меня простой вопрос: что такое совместная оценка? И что это значит в контексте регрессионного анализа? Как это сделать? Я довольно долго бродил по могучему Интернету, но не нашел ответов на эти вопросы.

3
Насколько хороша моя модель, основанная на значении диагностической метрики (
Я установил свою модель и пытаюсь понять, хороша ли она. Я рассчитал рекомендуемые показатели для его оценки ( / AUC / точность / ошибка прогнозирования / и т. Д.), Но не знаю, как их интерпретировать. Короче говоря, как мне определить, хороша ли моя модель по метрике? Достаточно ли 0,6 (например), …

2
Беспристрастная оценка экспоненты меры множества?
Предположим, что у нас есть (измеримое и соответственно хорошо себя ведущее) множество , где компактно. Кроме того, предположим, что мы можем извлечь образцы из равномерного распределения по относительно меры Лебега и что мы знаем меру . Например, возможно представляет собой коробку , содержащий .S⊆B⊂RnS⊆B⊂RnS\subseteq B\subset\mathbb R^nBBBBBBλ(⋅)λ(⋅)\lambda(\cdot)λ(B)λ(B)\lambda(B)BBB[−c,c]n[−c,c]n[-c,c]^nSSS Для фиксированного , существует …

2
В байесовском умозаключении почему некоторые термины исключены из апостериорного предиктивного?
В сопряженном байесовском анализе гауссовского распределения Кевина Мерфи он пишет, что апостериорное предиктивное распределение p(x∣D)=∫p(x∣θ)p(θ∣D)dθp(x∣D)=∫p(x∣θ)p(θ∣D)dθ p(x \mid D) = \int p(x \mid \theta) p(\theta \mid D) d \theta где DDD - данные, к которым подходит модель, а xxx - невидимые данные. Я не понимаю, почему зависимость от DDD исчезает в …

2
Почему функция потерь 0-1 неразрешима?
В книге глубокого обучения Яна Гудфеллоу написано, что Иногда функция потерь, о которой мы действительно заботимся (скажем, ошибка классификации), не может быть эффективно оптимизирована. Например, точное минимизация ожидаемых потерь 0-1 обычно трудно (экспоненциально во входном измерении) даже для линейного классификатора. В таких ситуациях обычно вместо этого оптимизируют функцию суррогатных потерь, …

1
Почему R Squared не является хорошей мерой для регрессии, подходящей с использованием LASSO?
Я читал в нескольких местах, что R Squared не является идеальной мерой, когда модель подгоняется с использованием LASSO. Однако я не совсем понимаю, почему это так. Кроме того, не могли бы вы порекомендовать лучшую альтернативу?

1
Что означает «вариационный»?
Всегда ли использование «вариационного» относится к оптимизации через вариационный вывод? Примеры: «Вариационный автокодер» «Вариационные байесовские методы» "Вариационная перенормировочная группа"

4
Что делает лассо нестабильным при выборе функции?
В сжатом восприятии есть теорема, гарантирующая, что имеет уникальное разреженное решение c (подробности см. В приложении).cargmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc Есть ли аналогичная теорема для лассо? Если такая теорема существует, она не только гарантирует стабильность лассо, но и дает лассо …

1
Понимание отрицательной регрессии гребня
Я ищу литературу об отрицательной регрессии гребня . Короче говоря, это обобщение линейной регрессии гребня с использованием отрицательного значения в формуле оценки:У положительного случая есть хорошая теория: как функция потерь, как ограничение, как при Байесе до ... но я чувствую себя потерянным с отрицательной версией только с приведенной выше формулой. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.