Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Расчет доверительных интервалов для логистической регрессии
Я использую биномиальную логистическую регрессию , чтобы определить , если воздействие has_xили has_yвоздействий на вероятность того , что пользователь нажмет на что - то. Моя модель следующая: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) Это вывод из моей модели: Call: glm(formula = has_clicked ~ …

4
Принятие нулевой гипотезы
Это дискуссионный вопрос о пересечении статистики и других наук. Я часто сталкиваюсь с одной и той же проблемой: исследователи в моей области, как правило, говорят, что нет никакого эффекта, когда значение p не меньше уровня значимости. В начале я часто отвечал, что это не то, как работает проверка гипотез. Учитывая, …

2
Что такое ошибка Байеса в машинном обучении?
http://www.deeplearningbook.org/contents/ml.html Page 116 объясняет ошибку Байеса, как показано ниже Идеальная модель - это оракул, который просто знает истинное распределение вероятностей, которое генерирует данные. Даже такая модель по-прежнему будет вызывать некоторые ошибки во многих проблемах, потому что в распределении все еще может быть шум. В случае контролируемого обучения отображение от x …

3
Методы решения проблемы пропущенных данных в машинном обучении
Практически в любой базе данных, в которой мы хотим делать прогнозы с использованием алгоритмов машинного обучения, найдутся пропущенные значения для некоторых характеристик. Существует несколько подходов к решению этой проблемы, чтобы исключить строки с пропущенными значениями, пока они не заполнятся средними значениями признаков. Я хотел бы использовать для несколько более надежного …

2
Коррелированные испытания Бернулли, многомерное распределение Бернулли?
Я упрощаю вопрос исследования, который у меня есть на работе. Представьте, что у меня 5 монет, и давайте назовем головы успешными. Это ОЧЕНЬ смещенные монеты с вероятностью успеха p = 0.1. Теперь, если монеты были независимыми, а затем получить вероятность , по крайней мере 1 голову или более очень просто, …

1
Как интерпретировать дифференциальную энтропию?
Недавно я прочитал эту статью об энтропии дискретного распределения вероятностей. Он описывает хороший способ восприятия энтропии как ожидаемых числовых битов (по крайней мере, при использовании в определении энтропии), необходимых для кодирования сообщения, когда ваша кодировка оптимальна, учитывая распределение вероятностей используемых вами слов.log2log2\log_2 Однако при распространении на непрерывный случай, как здесь, …

2
Что такое «базовый уровень» в кривой точного отзыва
Я пытаюсь понять точную кривую отзыва, я понимаю, что такое точность и отзыв, но не понимаю, что такое базовое значение. Я читал эту ссылку https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ и я не понимаю часть базовой линии, как показано в «Кривая точного восстановления идеального классификатора», что она делает? и как мы это вычисляем? Это просто …

1
Какой метод множественного сравнения использовать для модели lmer: lsmeans или glht?
Я анализирую набор данных, используя модель смешанных эффектов с одним фиксированным эффектом (условием) и двумя случайными эффектами (участник из-за дизайна объекта и пары). Модель была сгенерирована с lme4пакетом: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Затем я выполнил тест отношения правдоподобия этой модели по сравнению с моделью без фиксированного эффекта (условия) и получил значительную разницу. В …

3
Почему всегда есть хотя бы одна политика, которая лучше или равна всем другим политикам?
Усиление обучения: введение. Второе издание, в процессе ., Ричард С. Саттон и Эндрю Дж. Барто (с) 2012, с. 67-68. Решение задачи обучения с подкреплением означает, грубо говоря, поиск политики, которая в конечном итоге приносит много пользы. Для конечных MDP мы можем точно определить оптимальную политику следующим образом. Функции значения определяют …

3
Полезность теоремы Фриша-Во
Я должен преподавать теорему Фриша Во в эконометрике, которую я не изучал. Я понял математику, стоящую за этим, и я надеюсь, что идея «коэффициент, который вы получаете для определенного коэффициента из множественной линейной модели, равен коэффициенту простой регрессионной модели, если вы« исключаете »влияние других регрессоров». Так что теоретическая идея довольно …

5
Лучше ли проводить анализ разведочных данных только на наборе обучающих данных?
Я делаю предварительный анализ данных (EDA) на наборе данных. Затем я выберу некоторые функции для прогнозирования зависимой переменной. Вопрос в том, должен ли я делать EDA только для своего набора данных для обучения? Или я должен объединить учебные и тестовые наборы данных, а затем выполнить EDA для них обоих и …

1
Случайная проблема с параметрами
Я всегда изо всех сил пытаюсь понять истинную суть проблемы случайных параметров. Я несколько раз читал, что оценки фиксированных эффектов нелинейных панельных моделей данных могут быть сильно смещены из-за «хорошо известной» проблемы побочных параметров. Когда я прошу дать четкое объяснение этой проблемы, типичный ответ таков: предположим, что данные панели содержат …

2
Среднее значение ROC для повторной 10-кратной перекрестной проверки с оценками вероятности
Я планирую использовать повторную (10 раз) стратифицированную 10-кратную перекрестную проверку примерно в 10 000 случаев с использованием алгоритма машинного обучения. Каждый раз повторение будет сделано с разными случайными семенами. В этом процессе я создаю 10 экземпляров вероятностных оценок для каждого случая. 1 случай оценки вероятности для каждого из 10 повторений …
15 roc 

2
Как обновляются веса в методе пакетного обучения в нейронных сетях?
Может кто-нибудь сказать мне, как я должен построить нейронную сеть, используя пакетный метод? Я прочитал, что в пакетном режиме для всех выборок в обучающем наборе мы вычисляем ошибку, дельту и, следовательно, веса дельты для каждого нейрона в сети, а затем вместо немедленного обновления весов мы накапливаем их, а затем перед …

1
Включение условий взаимодействия в случайном лесу
Предположим, у нас есть ответ Y и предикторы X1, ...., Xn. Если бы мы попытались согласовать Y с помощью линейной модели X1, ...., Xn, и так получилось, что истинные отношения между Y и X1, ..., Xn не были линейными, мы могли бы исправить модель, преобразовав X как-то, а затем подгоняя …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.