Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Является ли теория вероятностей изучением неотрицательных функций, которые интегрируют / суммируют с одной?
Это, вероятно, глупый вопрос, но является ли теория вероятностей изучением функций, которые интегрируют / суммируют с одной? РЕДАКТИРОВАТЬ. Я забыл неотрицательность. Так является ли теория вероятностей изучением неотрицательных функций, которые интегрируют / суммируют с одной?

5
Почему мы берем квадратный корень дисперсии, чтобы создать стандартное отклонение?
Извините, если на это ответили в другом месте, я не смог найти его. Мне интересно, почему мы берем квадратный корень , в частности, дисперсию, чтобы создать стандартное отклонение? Что такое взятие квадратного корня, которое дает полезную ценность?

1
Какие классические обозначения в статистике, линейной алгебре и машинном обучении? И какие связи между этими обозначениями?
Когда мы читаем книгу, понимание обозначений играет очень важную роль в понимании содержания. К сожалению, разные сообщества имеют разные условные обозначения для формулировки модели и задачи оптимизации. Может ли кто-нибудь суммировать некоторые обозначения формулировки здесь и указать возможные причины? Я приведу здесь пример: в литературе по линейной алгебре классическая книга …

2
Что именно представляет собой альфа в распределении Дирихле?
Я довольно новичок в байесовской статистике, и я наткнулся на исправленную меру корреляции SparCC , которая использует процесс Дирихле в бэкэнде своего алгоритма. Я пытался пройтись по алгоритму шаг за шагом, чтобы действительно понять, что происходит, но я не уверен, что именно делает alphaпараметр вектора в распределении Дирихле и как …

3
Каково байесовское обоснование для анализа привилегий, проведенного раньше, чем другие анализы?
Предпосылки и эмпирический пример У меня есть два исследования; Я провел эксперимент (исследование 1), а затем повторил его (исследование 2). В исследовании 1 я обнаружил взаимодействие между двумя переменными; в исследовании 2 это взаимодействие было в том же направлении, но не значительным. Вот краткое изложение модели исследования 1: Coefficients: Estimate …
26 bayesian 

6
Как выбрать между ROC AUC и F1 баллом?
Я недавно закончил соревнование Kaggle, в котором по требованию соревнования использовался roc auc. До этого проекта я обычно использовал показатель f1 в качестве метрики для измерения производительности модели. В будущем мне будет интересно, как выбрать между этими двумя показателями? Когда использовать какие и каковы их плюсы и минусы? Кстати, я …

1
Один против всех и Один против одного в свм?
В чем разница между классификатором SVM «один против всех» и «один против одного»? Означает ли «один против всех» один классификатор, чтобы классифицировать все типы / категории нового изображения, и означает, что каждый тип / категория нового изображения классифицируется с помощью другого классификатора (каждая категория обрабатывается специальным классификатором)? Например, если новое …

1
Связь между вариационным байесовским и ЭМ
Я где-то читал, что вариационный метод Байеса является обобщением алгоритма EM. Действительно, итерационные части алгоритмов очень похожи. Чтобы проверить, является ли алгоритм EM специальной версией Вариационного Байеса, я попробовал следующее: YYY - данные, - коллекция скрытых переменных, а - параметры. В вариационном байесовском преобразовании мы можем сделать такое приближение, что …

1
Какая норма ошибки восстановления минимизируется матрицей аппроксимации низкого ранга, полученной с помощью PCA?
Учитывая приближение PCA (или SVD) матрицы с матрицей , мы знаем , что является лучшим низкоразрядным приближением .XXXX^X^\hat XX^X^\hat XXXX Это в соответствии с индуцированной нормой∥⋅∥2∥⋅∥2\parallel \cdot \parallel_2 (т. Е. Самой большой нормой собственных значений) или в соответствии с нормой Фробениуса ?∥⋅∥F∥⋅∥F\parallel \cdot \parallel_F

2
Почему Python scikait-learn LDA не работает правильно и как он вычисляет LDA через SVD?
Я использовал Линейный Дискриминантный Анализ (LDA) из scikit-learnбиблиотеки машинного обучения (Python) для уменьшения размерности, и мне было немного интересно узнать о результатах. Теперь мне интересно, что scikit-learnделает LDA , чтобы результаты выглядели иначе, чем, например, ручной подход или LDA, выполненные в R. Было бы здорово, если бы кто-то мог дать …

5
Интуитивное объяснение сходимости в распределении и сходимости по вероятности
Какова интуитивная разница между случайной величиной, сходящейся по вероятности, и случайной величиной, сходящейся по распределению? Я прочитал множество определений и математических уравнений, но это не очень помогает. (Пожалуйста, имейте в виду, я студент, изучающий эконометрику.) Как случайная величина может сходиться к одному числу, но также сходиться к распределению?

5
Почему эти утверждения не логически вытекают из 95% -ного КИ для среднего значения?
Я читал статью Hoekstra et al 2014 года «Надежное неверное истолкование доверительных интервалов», которую я скачал с сайта Wagenmakers . На предпоследней странице появляется следующее изображение. По мнению авторов, Ложь является правильным ответом на все эти утверждения. Я не очень уверен, почему заявления ложны, и, насколько я могу судить, остальная …

7
Проверка гипотезы распределения - какой смысл делать это, если вы не можете «принять» свою нулевую гипотезу?
Различные тесты гипотез, такие как тест GOF, Колмогоров-Смирнов, Андерсон-Дарлинг и т. Д., Следуют этому базовому формату:χ2χ2\chi^{2} ЧАС0H0H_0 : данные следуют заданному распределению. ЧАС1H1H_1 : данные не соответствуют данному распределению. Как правило, оценивается утверждение о том, что некоторые данные следуют некоторому заданному распределению, и если кто-то отвергает , данные не подходят …

2
Каково распределение
Каково распределение коэффициента детерминации или R в квадрате, R2R2R^2 , в линейной однофакторной множественной регрессии при нулевой гипотезе H0:β=0H0:β=0H_0:\beta=0 ? Как это зависит от количества предикторов kkk и количества выборок n>kn>kn>k ? Есть ли выражение для закрытой формы для режима этого распределения? В частности, у меня есть ощущение, что для …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.