Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как запрограммировать симуляцию Монте-Карло парадокса Бертрана?
Следующая проблема была размещена на Mensa International на странице Facebook: \quad\quad\quad\quad\quad\quad\quad\quad Само сообщение получило более 1000 комментариев, но я не буду вдаваться в подробности о дебатах, поскольку знаю, что это парадокс Бертранда и ответ . Что меня здесь интересует, так это то, как можно решить эту проблему, используя подход Монте-Карло? …

3
Исследователь 1 запускает 1000 регрессий, исследователь 2 запускает только 1, оба получают одинаковые результаты - должны ли они делать разные выводы?
Представьте, что исследователь исследует набор данных и запускает 1000 различных регрессий, и он обнаруживает одну интересную связь между ними. Теперь представьте, что другой исследователь с такими же данными запускает всего 1 регрессию, и оказывается, что это тот же самый, что другой исследователь взял 1000 регрессий, чтобы найти. Исследователь 2 не …

1
Обобщенные аддитивные модели (GAM), взаимодействия и ковариаты
Я исследовал ряд инструментов для прогнозирования и обнаружил, что Обобщенные аддитивные модели (GAM) обладают наибольшим потенциалом для этой цели. ГАМ - это здорово! Они позволяют указывать сложные модели очень кратко. Однако та же краткость вызывает у меня некоторую путаницу, особенно в отношении того, как GAM представляют себе термины взаимодействия и …
12 r  modeling  gam  mgcv 

1
Есть
Мой коллега хочет проанализировать некоторые данные после преобразования переменной ответа, подняв ее до степени (то естьу0,125).1818\frac18Y0,125y0.125y^{0.125} Мне неудобно с этим, но я не могу понять, почему. Я не могу придумать никакого механистического обоснования для этого преобразования. Также я никогда не видел этого раньше, и я волнуюсь, что, возможно, это раздувает …

5
Является ли линейная регрессия устаревшей? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 2 года назад . Сейчас я учусь в классе линейной регрессии, но я не могу избавиться от …

1
Резюме GAM Fit
Если мы соответствуем GAM, как: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Где мы используем набор данных College, который можно найти внутри пакета ISLR. …
12 anova  gam 

2
Понимание логистической регрессии и вероятности
Как работает оценка параметров / тренинг логистической регрессии? Я постараюсь поставить то, что у меня так далеко. Выходными данными являются выходные данные логистической функции в виде вероятности в зависимости от значения x: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} Для одного измерения так называемые шансы определяются следующим образом: p(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1xp(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1x{{p(y=1|x)}\over{1-p(y=1|x)}}={{p(y=1|x)}\over{p(y=0|x)}}=e^{\omega_0+\omega_1x} Теперь добавим logфункцию, чтобы получить W_0 …

2
Пример построения, показывающий
Как построить пример распределения вероятностей, для которого выполняется , предполагая ?E(1X)=1E(X)E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1 Неравенство, вытекающее из неравенства Дженсена для RV с положительными значениями, имеет вид (обратное неравенство, если ). Это потому, что отображение является выпуклым для и вогнутым для . Следуя условию равенства в неравенстве Дженсена, я предполагаю, что распределение должно быть …

3
Существует ли кто-то быстрее, чем Усэйн Болт сегодня?
РЕДАКТИРОВАТЬ: Меня больше интересуют технические вопросы и методология определения вероятности «истинного» максимума в данной популяции с учетом выборочной статистики. Есть проблемы с оценкой вероятности более быстрых бегунов, чем г-н Болт, по рекордным временам броска, которые являются одновременно очевидными и тонкими. Забавьте меня, воображая, что это не так. Усэйн Болт - …

1
Как можно справиться с отсутствующими данными при использовании сплайнов или дробных полиномов?
Я читаю построение многомерной модели: прагматический подход к регрессионному анализу, основанный на дробных полиномах для моделирования непрерывных переменных, автор Патрик Ройстон и Вилли Сауэрбрей. Пока что я впечатлен, и это интересный подход, который я раньше не рассматривал. Но авторы не имеют дело с отсутствующими данными. Действительно, на с. 17 они …

3
Является ли оптимизация PCA выпуклой?
Целевой функцией анализа главных компонентов (PCA) является минимизация ошибки восстановления в норме L2 (см. Раздел 2.12 здесь . Другое представление пытается максимизировать дисперсию проекции. У нас также есть отличная статья здесь: Какова целевая функция PCA ? ) Мой вопрос заключается в том, что оптимизация PCA выпуклая? (Я нашел некоторые обсуждения …

2
Сплайны в GLM и GAM
Неправильно ли, что сплайны доступны только в GAM-моделях, а не в GLM-моделях? Я слышал это некоторое время назад, и удивляюсь, является ли это просто заблуждением, или в этом есть доля правды. Вот иллюстрация:

5
Как мне интерпретировать этот Scatter Plot?
У меня есть точечная диаграмма, размер выборки которой равен числу людей по оси x и средней зарплате по оси y. Я пытаюсь выяснить, влияет ли размер выборки на среднюю зарплату. Это сюжет: Как мне интерпретировать этот сюжет?

1
Почему избыточное среднее значение параметризации ускоряет Гиббс MCMC?
В книге Gelman & Hill (2007) (Анализ данных с использованием регрессионных и многоуровневых / иерархических моделей) авторы утверждают, что включение избыточных средних параметров может помочь ускорить MCMC. Данный пример - это не вложенная модель "симулятора полета" (уравнение 13.9): YяγJδК∼ N( μ + γj [ i ]+ δк [ я ], …

2
Соревнования Kaggle просто выиграны случайно?
Соревнования Kaggle определяют итоговые рейтинги на основе проведенного тестового набора. Выдержанный тестовый набор является образцом; он не может быть репрезентативным для моделируемого населения. Поскольку каждое представление похоже на гипотезу, алгоритм, выигравший соревнование, может, совершенно случайно, в конечном итоге соответствовать тестовому набору лучше, чем другие. Другими словами, если бы был выбран …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.