Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
В чем смысл одномерной регрессии до многомерной регрессии?
В настоящее время я работаю над проблемой, в которой у нас небольшой набор данных, и меня интересует причинно-следственное влияние лечения на результат. Мой консультант поручил мне выполнить одномерную регрессию для каждого предиктора с результатом в качестве ответа, а затем назначением лечения в качестве ответа. То есть меня просят согласовать регрессию …

8
Как относиться к нелогичным ответам на опрос
Я представил опрос для образца художников. Один из вопросов состоял в том, чтобы указать процентную долю дохода, полученную от: художественной деятельности, государственной поддержки, частной пенсии, деятельности, не связанной с искусством. Около 65% респондентов ответили так, что сумма процентов равна 100. Остальные нет: например, есть те, кто отвечает, что 70% их …
13 survey  bias 

3
Действительно ли результаты тестов соответствуют нормальному распределению?
Я пытался узнать, какие дистрибутивы использовать в GLM, и я немного озадачен, когда использовать нормальный дистрибутив. В одной части моего учебника говорится, что нормальное распределение может быть полезным для моделирования результатов экзаменов. В следующей части спрашивается, какое распределение будет подходящим для моделирования страхового случая. На этот раз он сказал, что …

2
Является ли регрессия причиной, если нет пропущенных переменных?
Регрессия yyy на xxx не должна быть причинной, если есть пропущенные переменные, которые влияют как на xxx и на yyy . Но если не для пропущенных переменных и ошибки измерения, является ли регрессия причиной? То есть, если каждая возможная переменная включена в регрессию?

4
Подходят ли методы, основанные на MCMC, когда доступна максимальная апостериорная оценка?
Я заметил, что во многих практических применениях методы, основанные на MCMC, используются для оценки параметра, даже если апостериорный является аналитическим (например, потому что приоры были сопряженными). Для меня имеет смысл использовать MAP-оценки, а не MCMC-оценки. Может ли кто-нибудь указать, почему MCMC все еще является подходящим методом при наличии аналитического апостериора?

3
Сохраняются ли вероятности при преобразовании функций?
Я думаю, что это довольно просто, но, скажем, у меня есть случайная величина , является ли вероятность P ( X ≤ a ) такой же, как P ( f ( X ) ≤ f ( a ) ) для любой действительной непрерывной функции f ?XXXP(X≤a)P(X≤a)P(X \leq a)P(f(X)≤f(a))P(f(X)≤f(a))P(f(X) \leq f(a))fff

2
Почему выбор лучшего подмножества не является предпочтительным по сравнению с лассо?
Я читаю о выборе лучшего подмножества в книге «Элементы статистического обучения». Если у меня есть 3 предиктора x1,x2,x3x1,x2,x3x_1,x_2,x_3 , я создаю подмножеств:23=823=82^3=8 Подмножество без предикторов подмножество с предикторомx1x1x_1 подмножество с предикторомx2x2x_2 подмножество с предикторомx3x3x_3 подмножество с предикторамиx1,x2x1,x2x_1,x_2 подмножество с предикторамиx1,x3x1,x3x_1,x_3 подмножество с предикторамиx2,x3x2,x3x_2,x_3 подмножество с предикторамиx1,x2,x3x1,x2,x3x_1,x_2,x_3 Затем я проверяю все …

3
Почему начальная загрузка полезна?
Если все, что вы делаете, это повторная выборка из эмпирического распределения, почему бы просто не изучить эмпирическое распределение? Например, вместо того, чтобы изучать изменчивость путем повторной выборки, почему бы просто не определить количественно изменчивость по эмпирическому распределению?

1
Когда мы сравниваем группы по контрольным переменным, должны ли мы использовать тесты эквивалентности?
Во многих работах, в которых рассматриваются методы лечения и результаты, я вижу таблицы (обычно «таблица 1») того, что можно назвать переменными помех (часто демографическими, иногда медицинскими состояниями), с тестами значимости и текстом, такими как «группы были в целом схожи. не было существенных различий по XXXXX, см. таблицу ". Таким образом, …

2
Задача об оценке параметров
Пусть и - четыре случайные переменные, такие что , где - неизвестные параметры. Также предположим, что ,Тогда какой из них является правдой?Y 1 , Y 2 , Y 3 Y1,Y2,Y3Y_1,Y_2,Y_3Y 4Y4Y_4 Е ( Y 1 ) = θ 1 - θ 3 ; E ( Y 2 ) = θ …

2
Могу ли я использовать CLR (центрированное преобразование логарифмического отношения) для подготовки данных для PCA?
Я использую скрипт. Это для основных записей. У меня есть датафрейм, который показывает различные элементные композиции в столбцах на заданной глубине (в первом столбце). Я хочу провести с ним PCA, и меня не устраивает метод стандартизации, который я должен выбрать. Кто-нибудь из вас использовал clr()данные для подготовки prcomp()? Или это …

5
Распределение, которое имеет диапазон от 0 до 1 и с пиком между ними?
Существует ли какой-либо дистрибутив или я могу работать из другого дистрибутива, чтобы создать такой дистрибутив, как на изображении ниже (извините за плохие рисунки)? где я даю число (0,2, 0,5 и 0,9 в примерах), где должен быть пик, и стандартное отклонение (сигма), которое делает функцию более широкой или менее широкой. PS: …

2
Что такое байесовское глубокое обучение?
Что такое байесовское глубокое обучение и как оно относится к традиционной байесовской статистике и традиционному глубокому обучению? Каковы основные понятия и математика? Могу ли я сказать, что это просто непараметрическая байесовская статистика? Каковы его основные работы, а также его текущие основные разработки и приложения? PS: Bayesian Deep Learning привлекает большое …

1
Сравнение двух моделей, когда кривые ROC пересекают друг друга
Одна общая мера, используемая для сравнения двух или более классификационных моделей, заключается в использовании площади под кривой ROC (AUC) в качестве способа косвенной оценки их эффективности. В этом случае модель с большим AUC обычно интерпретируется как работающая лучше, чем модель с меньшим AUC. Но, согласно Vihinen, 2012 ( https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3303716/ ), …

2
Почему исследователи в области экономики используют линейную регрессию для бинарных переменных отклика?
В последнее время мне пришлось читать несколько статей по экономике (область, с которой я не слишком знаком). Одна вещь, которую я заметил, это то, что даже когда переменная отклика является двоичной, модели линейной регрессии, использующие OLS, повсеместны. Поэтому мой вопрос: Почему линейная регрессия предпочтительнее, например, логистической регрессии в области экономики? …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.