Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Плоские, сопряженные и гиперприоры. Кто они такие?
В настоящее время я читаю о байесовских методах в вычислительной молекулярной эволюции Янга. В разделе 5.2 говорится о приорах, в частности неинформативных / плоских / расплывчатых / диффузных, сопряженных и гиперприорных. Возможно, это требует чрезмерного упрощения, но может ли кто-нибудь объяснить просто разницу между этими типами приоров и как это …
15 bayesian  prior 

2
Закон полной дисперсии как теорема Пифагора
Предположим, что и имеют конечный второй момент. В гильбертовом пространстве случайных величин со вторым конечным моментом (с внутренним произведением определяемым , ), мы можем интерпретировать как проекция на пространство функций .XXXYYYT1,T2T1,T2T_1,T_2E(T1T2)E(T1T2)E(T_1T_2)||T||2=E(T2)||T||2=E(T2)||T||^2=E(T^2)E(Y|X)E(Y|X)E(Y|X)YYYXXX Мы также знаем, что Закон полной дисперсии читается как Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X)) + Var(E(Y|X)) Есть ли способ интерпретировать этот закон с …

2
Извлечь данные из скользящей средней?
Можно ли извлечь точки данных из данных скользящего среднего? Другими словами, если набор данных имеет только простые скользящие средние из предыдущих 30 точек, возможно ли извлечь исходные точки данных? Если так, то как?

2
Точное значение и сравнение между влиятельной точкой, точкой высокого плеча и выбросом?
Из Википедии Влиятельные наблюдения - это те наблюдения, которые относительно сильно влияют на прогнозы регрессионной модели. Из Википедии Точки воздействия - это те наблюдения, если таковые имеются, сделанные при экстремальных или внешних значениях независимых переменных, так что отсутствие соседних наблюдений означает, что подобранная модель регрессии пройдет близко к этому конкретному …

1
Как интерпретировать коэффициенты из бета-регрессии?
У меня есть некоторые данные, которые ограничены между 0 и 1. Я использовал betaregпакет в R, чтобы подогнать регрессионную модель с ограниченными данными в качестве зависимой переменной. У меня вопрос: как мне интерпретировать коэффициенты из регрессии?

1
Может ли начальная загрузка использоваться для замены непараметрических тестов?
Я довольно плохо знаком со статистикой. Концепция начальной загрузки меня смутила. Я знаю, что для нормального распределения выборки необходимо использовать определенные тесты, такие как t-критерий. В случаях, когда данные обычно не распространяются, запрос «начальной загрузки» в t-тестах в SPSS обойдёт ли это проблему ненормальности? Если да, то является ли t-статистика, …

5
Генерация нормально распределенных случайных чисел с неположительно определенной ковариационной матрицей
Я оценил образец ковариационной матрицы образца и получил симметричную матрицу. С , я хотел бы создать -мерного нормальный распределенный гп , но поэтому мне нужно разложение Холецкого . Что мне делать, если не является положительно определенным?C n C CССCССCNNnССCССC


5
Что именно строит статистическую модель?
Что именно строит статистическую модель? В наши дни, когда я подаю заявку на исследовательскую работу или консультационную работу, часто появляется термин «построение модели» или «моделирование». Термин звучит круто, но к чему именно они относятся? Как вы строите свою модель? Я посмотрел прогнозное моделирование , которое включает в себя k-nn и …
15 modeling 

1
Прогнозирование временных рядов с ежедневными данными: ARIMA с регрессором
Я использую ежедневные временные ряды данных о продажах, которые содержат около 2 лет ежедневных точек данных. Основываясь на некоторых онлайн-уроках / примерах, я попытался определить сезонность в данных. Кажется, что есть еженедельная, ежемесячная и, вероятно, годовая периодичность / сезонность. Например, существуют дни выплаты, особенно в первый день выплаты за месяц, …

1
Можно ли перевести соотношение рисков в медианы времени выживания?
В одной статье, описывающей результаты анализа выживаемости, я прочитал утверждение, которое подразумевает, что можно перевести отношение рисков (HR) в отношение средних времен выживания ( и ), используя формулу:М 2M1M1M_1M2M2M_2 ЧАСR = M1M2ЧАСрзнак равноM1M2HR = \frac{M_1}{M_2} Я уверен, что это не имеет места, когда нельзя принять пропорциональную модель риска (поскольку ничто …
15 survival  hazard 

1
Произведение двух независимых случайных величин
У меня есть образец около 1000 значений. Эти данные получены из произведения двух независимых случайных величин ξ∗ψξ∗ψ\xi \ast \psi . Первая случайная величина имеет равномерное распределение ξ∼U(0,1)ξ∼U(0,1)\xi \sim U(0,1) . Распределение второй случайной величины неизвестно. Как я могу оценить распределение второй ( ψψ \psi ) случайной величины?

3
Может ли лемма Неймана-Пирсона применяться к случаю, когда простой нуль и альтернатива не принадлежат одному семейству распределений?
Может ли лемма Неймана-Пирсона применяться к случаю, когда простой нуль и простая альтернатива не принадлежат одному семейству распределений? Из его доказательства я не понимаю, почему он не может. Например, когда простой ноль - это нормальное распределение, а простой альтернативой - экспоненциальное распределение. Является ли проверка отношения правдоподобия хорошим способом проверки …

1
Разница между тестом рандомизации и тестом перестановки
В литературе термины Рандомизация и Перестановка используются взаимозаменяемо. Со многими авторами констатируют «тесты перестановки (или рандомизации)», или наоборот. В лучшем случае я считаю, что разница невелика, и она заключается в их предположениях о данных и возможных выводах, которые можно сделать. Мне просто нужно проверить, правильно ли мое понимание или есть …

2
Канонический корреляционный анализ с ранговой корреляцией
Канонический корреляционный анализ (CCA) стремится максимизировать обычную корреляцию Пирсона с моментом произведения (то есть линейный коэффициент корреляции) линейных комбинаций двух наборов данных. Теперь рассмотрим тот факт , что этот коэффициент корреляции только измеряет линейные ассоциаций - это причина того, почему мы используем, например, Spearman- или Кендал (ранг) коэффициенты корреляции измеряющие …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.