Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Определение динамической байесовской системы и ее связь с HMM?
Из Википедии Динамическая байесовская сеть (DBN) - это байесовская сеть, которая связывает переменные друг с другом в течение смежных временных шагов. Это часто называют BN с двумя временами, потому что оно говорит, что в любой момент времени T значение переменной может быть вычислено из внутренних регрессоров и непосредственного предшествующего значения …

1
Смешанные модели множественных сравнений для взаимодействия между непрерывным и категориальным предиктором
Я хотел бы использовать lme4для подбора регрессии смешанных эффектов и multcompдля вычисления парных сравнений. У меня есть сложный набор данных с несколькими непрерывными и категориальными предикторами, но мой вопрос может быть продемонстрирован на примере встроенного ChickWeightнабора данных: m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, REML=F) …

1
Дирихле задний
У меня есть вопрос о заднем распределении Дирихле. Учитывая полиномиальную функцию правдоподобия, известно, что апостериор - это , где - количество раз, когда мы видели наблюдение.N i i t hD i r ( αя+ Nя)Dir(αi+Ni)Dir({\alpha_i + N_i})NяNiN_iят чithi^{th} Что произойдет, если мы начнем уменьшать s для заданных фиксированных данных ? …

2
Как называется это дискретное распределение (рекурсивное разностное уравнение), которое я получил?
Я наткнулся на этот дистрибутив в компьютерной игре и хотел узнать больше о ее поведении. Это связано с решением относительно того, должно ли происходить определенное событие после определенного количества действий игрока. Подробности за этим не имеют значения. Это кажется применимым к другим ситуациям, и я нашел это интересным, потому что …

3
Интуиция и использует для коэффициента вариации
В настоящее время я посещаю курс « Введение в управление операциями» на Coursera.org. В какой-то момент в курсе профессор начал заниматься изменением времени операций. Измерение, которое он использует, представляет собой Коэффициент вариации , отношение стандартного отклонения к среднему: cv=σμcv=σμc_v = \frac{\sigma}{\mu} Почему это измерение будет использоваться? Каковы преимущества и недостатки …

2
Почему данные должны быть пересчитаны при нулевой гипотезе при тестировании гипотезы при начальной загрузке?
Простое применение методов начальной загрузки к проверке гипотез состоит в том, чтобы оценить доверительный интервал тестовой статистики , многократно вычисляя его по загрузочным выборкам (пусть статистика взятая из начальной загрузки, называется ). Мы отвергаем если предполагаемый параметр (который обычно равен 0) находится за пределами доверительного интервала . ; & thetas …

3
Каковы предположения факторного анализа?
Я хочу проверить, действительно ли я понял [классический, линейный] факторный анализ (ФА), особенно предположения , сделанные до (и, возможно, после) ФА. Некоторые данные должны быть изначально коррелированы, и между ними возможна линейная связь. После проведения факторного анализа данные обычно распределяются (двумерное распределение для каждой пары), и нет никакой корреляции между …

2
Что такое расстояние Махаланобиса и как оно используется в распознавании образов?
Может кто-нибудь объяснить мне концепцию расстояния Махаланобиса? Например, каково расстояние Махаланобиса между двумя точками x и y, и особенно, как оно интерпретируется для распознавания образов?

1
Что такое «багплот» или «двумерный боксплот»?
Я нашел статью, которая представляет многомерную (двумерную здесь) версию коробочного графика - багплот. Что это за мешок? Я вижу серию вложенных полигонов, основанных на вершинах, один из тех полигонов объявлен как пакет. В чем идея построения вложенного многоугольника? Какой из полигонов является багплотом (центральным или со средним количеством очков)? Обладают …

2
Допущения о пуассоновской регрессии и как их проверить в R
Я хотел бы проверить, какая регрессия лучше всего подходит для моих данных. Моя зависимая переменная - это число и имеет много нулей. И мне понадобится некоторая помощь, чтобы определить, какую модель и семейство использовать (пуассоновское или квазипуассонное или нулевая инфляция пуассоновых регрессий) и как проверить предположения. Регрессия Пуассона: насколько я …

2
Омега против альфа надежности
Интересно, может кто-нибудь объяснить, в чем главное отличие омега-альфа-надежности? Я понимаю, что надежность омеги основана на иерархической факторной модели, как показано на следующем рисунке, и альфа использует средние межэлементные корреляции. Что я не понимаю, так это то, в каком состоянии коэффициент достоверности омега будет выше, чем коэффициент альфа, и наоборот? …

1
Получение разных результатов при построении эллипсов 95% CI с помощью ggplot или пакета эллипсов
Я хочу визуализировать результаты кластеризации (созданные с помощью protoclust{protoclust}), создавая диаграммы разброса для каждой пары переменных, используемых для классификации моих данных, раскраски по классам и перекрытия эллипсов для 95% доверительного интервала для каждого из классов (чтобы проверить, какие elipses-классы перекрываются под каждой парой переменных). Я реализовал рисование эллипсов двумя разными …

3
Использование компьютерного моделирования для лучшего понимания статистических концепций на уровне выпускника
Привет, я прохожу аспирантуру по статистике, и мы освещали тестовую статистику и другие концепции. Тем не менее, я часто могу применять формулы и развивать своего рода интуицию о том, как все работает, но у меня часто возникает ощущение, что, возможно, если я подкреплю свое исследование симуляцией экспериментов, я разовью лучшую …

2
Построение временного ряда, включающего несколько наблюдений для каждой даты
Я пытаюсь применить временной ряд к ежеквартальным данным выборки (биомасса животных) за 10-летний период с 3 повторениями в квартал. Итак, 40 дат, но всего 120 наблюдений. Я прочитал до SARIMA'а в Shumway и Stoffer's Анализ временных рядов и его приложений, а также просмотрел Woodward, et. Прикладной анализ временных рядов, и …
11 r  time-series 

1
Могут ли эти данные быть объединены в пропорции для биномиального глм?
Мы попросили 60 человек перечислить как можно больше ресторанных франшиз в Атланте. Общий список включал более 70 ресторанов, но мы исключили те, которые были упомянуты менее чем 10% людей, оставив нам 45. Для этих 45 мы рассчитали долю информантов, которые перечислили франшизу, и нас интересует моделирование этой пропорции в зависимости …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.