Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Представляют ли ребра в ориентированном ациклическом графе причинность?
Я изучаю вероятностные графические модели , книгу для самостоятельного изучения. Представляют ли ребра в ориентированном ациклическом графе (DAG) причинные связи? Что если я хочу построить байесовскую сеть , но я не уверен в направлении стрелок в ней? Все данные скажут мне, что наблюдаются корреляции, а не взаимосвязь между ними. Я …

5
Множественное вменение для пропущенных значений
Я хотел бы использовать вменение для замены отсутствующих значений в моем наборе данных при определенных ограничениях. Например, я бы хотел, чтобы вмененная переменная x1была больше или равна сумме двух других моих переменных, скажем, x2и x3. Я также хочу x3быть вмененным либо 0или, >= 14и я хочу x2быть вмененным либо 0или …

1
Гамма GLM с логарифмической связью против гауссовой GLM с логарифмической связью против LM с логарифмическим преобразованием
Из моих результатов видно, что GLM Gamma отвечает большинству допущений, но стоит ли это значительного улучшения по сравнению с лог-преобразованным LM? Большая часть литературы, которую я нашел, посвящена пуассоновским или биномиальным GLM. Я нашел статью ОЦЕНКА ОБОБЩЕНИЙ ОБОБЩЕННОЙ ЛИНЕЙНОЙ МОДЕЛИ С ИСПОЛЬЗОВАНИЕМ Рандомизации очень полезной, но в ней отсутствуют реальные …

4
Различие между линейной и нелинейной моделью
Я прочитал некоторые объяснения о свойствах линейных и нелинейных моделей, но все же иногда я не уверен, является ли имеющаяся модель линейной или нелинейной. Например, является ли следующая модель линейной или нелинейной? YT= β0+ β1B ( L ; θ ) XT+ εTyt=β0+β1B(L;θ)Xt+εty_t=\beta_0 + \beta_1B(L;\theta)X_t+\varepsilon_t С: B ( L ; θ …

3
Нужно ли отбрасывать переменные, которые коррелированы / коллинеарны перед запуском kmeans?
Я использую kmeans для определения групп клиентов. У меня есть около 100 переменных для определения кластеров. Каждая из этих переменных представляет собой процент расходов клиента на категорию. Итак, если у меня есть 100 категорий, у меня есть эти 100 переменных, так что сумма этих переменных составляет 100% для каждого клиента. …

1
Условия существования информационной матрицы Фишера
В разных учебниках приводятся разные условия существования информационной матрицы Фишера. Ниже перечислены несколько таких условий, каждое из которых встречается в некоторых, но не во всех определениях «информационной матрицы Фишера». Есть ли стандартный, минимальный набор условий? Из 5 приведенных ниже условий, с которыми можно покончить? Если с одним из условий можно …

4
Как выбрать начальные значения для подгонки нелинейных наименьших квадратов
Вопрос выше говорит обо всем. По сути, мой вопрос касается общей функции подбора (может быть произвольно сложной), которая будет нелинейной по параметрам, которые я пытаюсь оценить. Как выбрать начальные значения для инициализации подбора? Я пытаюсь сделать нелинейные наименьшие квадраты. Есть ли стратегия или метод? Это изучалось? Любые ссылки? Что-нибудь кроме …

1
Коэффициенты пути - сравнение регрессии гребня, лассо и эластичной сетки
Я хотел бы сравнить модели, выбранные с ребристой, лассо и эластичной сеткой. На рисунке ниже показаны коэффициенты пути, используя все 3 метода: гребень (рис. A, альфа = 0), лассо (рис. B; альфа = 1) и эластичная сетка (рис. C; альфа = 0,5). Оптимальное решение зависит от выбранного значения лямбда, которое …

2
Связь между коэффициентами корреляции Фи, Мэтьюса и Пирсона
Являются ли коэффициенты корреляции фи и Мэтьюса одним и тем же понятием? Как они связаны или эквивалентны коэффициенту корреляции Пирсона для двух двоичных переменных? Я предполагаю, что двоичные значения равны 0 и 1. Корреляция Пирсона между двумя случайными величинами Бернулли и :уxxxyyy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y - …

1
Можете ли вы сравнить значения AIC, если модели основаны на одном и том же наборе данных?
Я делаю некоторые прогнозы в R, используя пакет прогнозов Роба Хиндмана . Бумага, принадлежащая упаковке, может быть найдена здесь . В статье после объяснения алгоритмов автоматического прогнозирования авторы реализуют алгоритмы на одном и том же наборе данных. Однако, после оценки как экспоненциального сглаживания, так и модели ARIMA, они делают заявление, …

3
Альтернатива одностороннему неравенству ANOVA
Я хотел бы сравнить средства по трем группам равных размеров (одинаковый размер выборки мал, 21). Средства каждой группы будут нормально распределены, но их дисперсия не равна (проверено с помощью Levene - х). Является ли преобразование лучшим маршрутом в этой ситуации? Должен ли я рассмотреть что-нибудь еще в первую очередь?

3
Общий рейтинг из нескольких рейтинговых списков
Я просмотрел много литературы, доступной в Интернете, в том числе этот форум, но безуспешно и надеюсь, что кто-то может помочь в статистической проблеме, с которой я сейчас сталкиваюсь: У меня есть 5 списков ранжированных данных, каждый из которых содержит 10 пунктов, ранжированных от позиции 1 (лучшая) до позиции 10 (худшая). …

1
Понимание MCMC и алгоритма Метрополис-Гастингс
В последние несколько дней я пытался понять, как работает Марковская цепь Монте-Карло (MCMC). В частности, я пытался понять и реализовать алгоритм Метрополис-Гастингс. Пока я думаю, что у меня есть общее представление об алгоритме, но есть пара вещей, которые мне еще не ясны. Я хочу использовать MCMC для подгонки некоторых моделей …

1
Несколько степеней свободы линейной регрессии
Степени свободы в множественной регрессии равны , где k - количество переменных.N- к - 1N−k−1N-k-1Кkk Включает ли переменную ответа (то есть Y )? Например, в модели Y = B 0 + B 1 X 1 + B 2 X 2 , тогда k = 3 (то есть 1 df каждый …

3
Евклидово расстояние и сходство
Я просто работаю с книгой Коллективный разум (Тоби Сегаран) и натолкнулся на евклидову оценку расстояния. В книге автор показывает, как рассчитать сходство между двумя массивами рекомендаций (например, .человек × фильм ↦ оценка )person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) Он вычисляет евклидово расстояние для двух человек и по p 2 d ( …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.