Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Сравнение двух гистограмм с использованием расстояния хи-квадрат
Я хочу сравнить два изображения лиц. Я рассчитал их LBP-гистограммы. Итак, теперь мне нужно сравнить эти две гистограммы и получить что-то, что скажет, насколько эти гистограммы равны (0 - 100%). Существует много способов решения этой задачи, но авторы метода LBP подчеркивают (Face Face with Local Binary Patterns: Application to Face …

4
Почему разделение данных на набор для обучения и тестирования недостаточно
Я знаю, что для того, чтобы получить доступ к характеристикам классификатора, мне нужно разделить данные на обучающие / тестовые наборы. Но читая это : При оценке различных настроек («гиперпараметров») для оценщиков, таких как настройки C, которые должны быть установлены вручную для SVM, все еще существует риск перенастройки на тестовом наборе, …

3
Хороший пример, где ряд без единичного корня не является стационарным?
Я видел, как несколько раз люди отклоняли нуль в расширенном тесте Дики-Фуллера , а затем утверждали, что он показывает, что их ряды стационарны (к сожалению, я не могу показать источники этих утверждений, но я думаю, что подобные утверждения существуют здесь и там в тот или иной журнал). Я утверждаю, что …

5
Что такое размер эффекта ... и почему он полезен?
У меня есть опыт работы на уровне начального уровня для выпускников (предположим, я знаю математическую статистику и вероятность на уровне бакалавриата (например, Wackerly et al., Ross 'Вероятность) и немного знаком с теорией мер). Недавно я начал работу по созданию экспериментального дизайна и статистической отчетности в области статистики образования, и меня …

1
Шпаргалка ANOVA Алфавитный суп и регрессивные эквиваленты
Могу ли я получить помощь в завершении этой пробной (находящейся в процессе) попытки получить ориентиры по эквивалентам ANOVA и REGRESSION? Я пытался согласовать понятия, номенклатуру и синтаксис этих двух методологий. На этом сайте есть много сообщений об их общности, например, об этом или об этом , но все же хорошо …

1
Парадокс в выборе модели (AIC, BIC, объяснить или предсказать?)
Прочитав книгу Галита Шмуэли «Объяснить или предсказать» (2010), я озадачен очевидным противоречием. Есть три помещения, Выбор модели на основе BIC по сравнению с BIC (конец стр. 300 - начало стр. 301): проще говоря, AIC следует использовать для выбора модели, предназначенной для прогнозирования, в то время как BIC следует использовать для …

2
Осмысление анализа независимых компонентов
Я видел и наслаждался вопросом « Осмысление анализа главных компонентов» , и теперь у меня такой же вопрос для анализа независимых компонентов. Я имею в виду, я хочу задать всеобъемлющий вопрос об интуитивных способах понимания ICA? Я хочу это понять . Я хочу получить цель этого. Я хочу почувствовать это. …
18 intuition  ica 

2
В чем проблема с эмпирическими приорами?
В литературе я иногда натыкаюсь на замечание, что выбор априорных значений, которые зависят от самих данных (например, Zellners g-prior), можно подвергнуть критике с теоретической точки зрения. Где именно проблема, если предшествующее не выбрано независимо от данных?

2
В модели Пуассона, в чем разница между использованием времени как ковариаты или смещения?
Недавно я обнаружил, как моделировать экспозиции во времени, используя журнал (например) времени как смещение в регрессии Пуассона. Я понял, что смещение соответствует времени как ковариации с коэффициентом 1. Я хотел бы лучше понять разницу между использованием времени в качестве смещения или в качестве обычного ковариата (поэтому оценка коэффициента). В какой …


1
Доказательство формулы LOOCV
Из «Введения в статистическое обучение » Джеймса и др., Оценка перекрестной проверки (LOOCV) определяется как где .резюме( н )= 1NΣя = 1NMSEярезюме(N)знак равно1NΣязнак равно1NMSEя\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\text{MSE}_iMSEя= ( уя- у^я)2MSEязнак равно(Yя-Y^я)2\text{MSE}_i = (y_i-\hat{y}_i)^2 Без доказательства уравнение (5.2) утверждает, что для регрессии наименьших квадратов или полиномиальной регрессии (относится ли это к регрессии …

1
Интерпретация провала Хартиганса
Я хотел бы найти способ количественно оценить интенсивность бимодальности некоторых распределений, которые я получил эмпирически. Из того, что я прочитал, до сих пор идут споры о том, как количественно определить бимодальность. Я решил использовать тест Хартиганса, который кажется единственным, доступным на R (оригинал статьи: http://www.stat.washington.edu/wxs/Stat593-s03/Literature/hartigan85a.pdf ). Тест на погружение Хартиганса …
18 r  distributions 

1
Как сообщается матрица путаницы из K-кратной перекрестной проверки?
Предположим, я делаю перекрестную проверку в K-кратном порядке с K = 10-кратным. Там будет одна матрица путаницы для каждого сгиба. Когда я сообщаю о результатах, я должен вычислить, какова средняя матрица путаницы, или просто суммировать матрицы путаницы?

1
Существует ли четкий набор условий, при которых пути лассо, гребня или эластичной сетки монотонны?
Вопрос « Что делать из этого лассо-графика (glmnet)» демонстрирует пути решения для оценки лассо, которые не являются монотонными. То есть некоторые коэффициенты растут по абсолютной величине, а затем сокращаются. Я применил эти модели к нескольким видам наборов данных и никогда не видел такого поведения «в дикой природе», и до сегодняшнего …

5
Зачем использовать теорию экстремальных ценностей?
Я исхожу из гражданского строительства, в котором мы используем теорию экстремальных значений , такую ​​как распределение GEV, для прогнозирования значения определенных событий, таких как наибольшая скорость ветра , т. Е. Значение, до которого 98,5% скорости ветра будет ниже. У меня такой вопрос: зачем использовать такое экстремальное распределение ценностей ? Не …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.