Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Дивергенция Кульбака – Лейблера между двумя гамма-распределениями
Выбор параметризации гамма-распределения с помощью pdf Дивергенция Кульбака-Лейблера между и определяется как [1] ​​какΓ(b,c)Γ(b,c)\Gamma(b,c)g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b}Γ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)Γ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p) KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} Я предполагаю, что - это функция дигаммы . Ψ(x):=Γ′(x)/Γ(x)Ψ(x):=Γ′(x)/Γ(x)\Psi(x):= \Gamma'(x)/\Gamma(x) …

8
Как НЕ использовать статистику
Это своего рода открытый вопрос, но я хочу быть ясным. При достаточной численности населения вы могли бы чему-то научиться (это открытая часть), но что бы вы ни узнали о своем населении, когда это когда-либо применимо к члену населения? Из того, что я понимаю в статистике, это никогда не применимо к …

2
Каковы различия между «Моделированием смешанных эффектов» и «Моделированием скрытого роста»?
Я неплохо знаком с моделями смешанных эффектов (MEM), но недавно один из коллег спросил меня, как они соотносятся с моделями скрытого роста (LGM). Я немного погуглил, и кажется, что LGM - это вариант моделирования структурных уравнений, который применяется к обстоятельствам, когда повторяющиеся измерения получаются на каждом уровне, по крайней мере, …

1
Внедряет ли GSVD все линейные многомерные методы?
Я наткнулся на статью Эрве Абди об обобщенном СВД. Автор упомянул: Обобщенный SVD (GSVD) разбивает прямоугольную матрицу и учитывает ограничения, накладываемые на строки и столбцы матрицы. GSVD дает взвешенную обобщенную оценку наименьших квадратов данной матрицы с помощью матрицы более низкого ранга и, следовательно, при адекватном выборе ограничений GSVD реализует все …

2
Как построить эллипс из собственных значений и собственных векторов в R? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Может ли кто-нибудь придумать R- код для построения эллипса из собственных значений и собственных векторов следующей матрицы А = …

1
Как проверить, какая модель лучше в анализе временных рядов в пространстве состояний?
Я делаю анализ данных временных рядов методами пространства состояний. По моим данным, стохастическая модель локального уровня полностью превзошла детерминированную. Но детерминистическая модель уровня и уклона дает лучшие результаты, чем со стохастическим уровнем и стохастическим / детерминированным уклоном. Это что-то обычное? Все методы в R требуют начальных значений, и я где-то …

3
Можно ли использовать расстояние Манхэттена с межкластерными связями Уорда в иерархической кластеризации?
Я использую иерархическую кластеризацию для анализа данных временных рядов. Мой код реализован с использованием функции MathematicaDirectAgglomerate[...] , которая генерирует иерархические кластеры с учетом следующих входных данных: матрица расстояний D название метода, используемого для определения межкластерной связи. Я рассчитал матрицу расстояний D, используя расстояние Манхэттен: d(x,y)=∑i|xi−yi|d(x,y)=∑i|xi−yi|d(x,y) = \sum_i|x_i - y_i| где …

1
Кластеризация: я должен использовать расхождение Дженсена-Шеннона или его квадрат?
Я группирую распределения вероятностей, используя алгоритм распространения сродства , и планирую использовать расхождение Дженсена-Шеннона в качестве метрики расстояния. Правильно ли использовать сам JSD в качестве расстояния или JSD в квадрате? Почему? Какие различия могут возникнуть в результате выбора одного или другого?


2
Связь между байесовской статистикой и генеративным моделированием
Может ли кто-нибудь отослать меня к хорошей справке, которая объясняет связь между байесовской статистикой и методами генеративного моделирования? Почему мы обычно используем генеративные модели с байесовскими методами? Почему особенно привлекательно использовать байесовскую статистику в случае отсутствия полных данных, если вообще? Обратите внимание, что я пришел из более ориентированного на машинное …

3
Как агрегировать по минутам данные за неделю в почасовые средства?
Как бы вы получили почасовые средние значения для нескольких столбцов данных за ежедневный период и показывали результаты для двенадцати "хостов" на одном графике? То есть я хотел бы наметить, как выглядит 24-часовой период для данных за недели. Конечной целью будет сравнение двух наборов этих данных до и после выборок. dates …

5
Разница между терминами «совместное распределение» и «многомерное распределение»?
Я пишу об использовании «совместного распределения вероятностей» для аудитории, которая с большей вероятностью поймет «многомерное распределение», поэтому я подумываю использовать позже. Тем не менее, я не хочу терять смысл при этом. Википедия, кажется, указывает, что это синонимы. Они? Если нет, то почему нет?

2
Экспоненциально взвешенная подвижная асимметрия / эксцесс
Существуют хорошо известные онлайн-формулы для вычисления экспоненциально взвешенных скользящих средних и стандартных отклонений процесса . Для среднего,(xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots} μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n и для дисперсии σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) из которого вы можете вычислить стандартное отклонение. Существуют ли похожие формулы для онлайн-расчета …

3
Хорошее введение во временные ряды (с R)
В настоящее время я собираю данные для эксперимента по психосоциальным характеристикам, связанным с переживанием боли. Как часть этого, я собираю измерения GSR и BP в электронном виде от моих участников, наряду с различными самоотчётами и скрытыми измерениями. У меня психологический фон, и я чувствую себя комфортно с факторным анализом, линейными …

3
Как оптимизировать мой R скрипт для использования «многоядерности»
Я использую GNU R на ПК с Ubuntu-Lucid, который имеет 4 процессора. Чтобы использовать все 4 процессора, я установил пакет «r-cran-multicore». Поскольку в руководстве по пакету отсутствуют практические примеры, которые я понимаю, мне нужен совет, как оптимизировать мой сценарий, чтобы использовать все 4 процессора. Мой набор данных - это data.frame …
15 r 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.