Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Получение векторов коинтеграции методом Йохансена
Я пытаюсь лучше понять метод Йохансена, поэтому разработал пример 3.1, приведенный в книге «Метод вероятностного вывода-коинтеграции-авторегрессии-эконометрики», в котором мы имеем три процесса: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} поэтому векторы коинтеграции должны быть [a, -1, 0] и [0, …

4
Можно ли использовать критерий Манна-Уитни для сравнений после Крускала-Уоллиса?
У меня есть симуляция, когда животное помещают в агрессивную среду и рассчитывают, как долго оно сможет выжить, используя какой-то подход к выживанию. Есть три подхода, которые он может использовать, чтобы выжить. Я провел 300 симуляций животного, используя каждый подход к выживанию. Все моделирования происходят в одной и той же среде, …

1
Как генерировать данные о выживаемости с зависимыми от времени ковариатами, используя R
Я хочу сгенерировать время выживания из модели пропорциональных рисков Кокса, которая содержит зависящий от времени ковариат. Модель h ( t | Xя) = ч0( т ) опыт( γИкся+ α мя( т ) )h(t|Xi)=h0(t)exp⁡(γXi+αmi(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) где генерируется из бинома (1,0.5) и m i ( t ) …

2
Что делать, если CFA подходит для масштабирования нескольких элементов плохо?
Я не уверен, как поступить с этим CFA, который я делаю в Lavaan. У меня есть выборка из 172 участников (я знаю, что это немного для CFA) и 28 предметов с 7-балльной шкалой Лайкерта, которая должна загружаться по семи факторам. Я сделал CFA с «mlm» -этиматорами, но подгонка модели была …

1
Почему вы должны предоставить модель вариограммы во время кригинга?
Я очень плохо знаком с пространственной статистикой и смотрю много уроков, Но я не совсем понимаю, почему вы должны предоставить модель вариограммы, когда кригите. Я использую пакет gstat в R, и это пример, который они дают: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m <- vgm(.59, "Sph", …
9 spatial 

2
Кластеризация шумных данных или с выбросами
У меня есть шумные данные двух переменных, как это. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, …

1
Стандартизация функций при использовании LDA в качестве этапа предварительной обработки
Если для уменьшения размерности (или преобразования после уменьшения размерности с помощью PCA) используется мультиклассовый линейный дискриминантный анализ (или я иногда также читаю множественный дискриминантный анализ), я понимаю, что в целом «нормализация по Z-шкале» (или стандартизация) Функции не будут необходимы, даже если они измерены в совершенно разных масштабах, правильно? Поскольку LDA …

1
Почему алгоритм EM должен быть итеративным?
Предположим, что у вас есть популяция с единицами, каждая со случайной величиной . Вы наблюдаете значений для любой единицы измерения, для которой . Мы хотим оценить .X i ∼ Пуассона ( λ ) n = N - n 0 X i > 0 λNNNИкся∼ Пуассон ( λ )Икся~Пуассон(λ)X_i \sim \text{Poisson}(\lambda)n …

1
Понимание разложения по сингулярным значениям в контексте LSI
Мой вопрос, как правило, касается разложения по сингулярным значениям (SVD) и, в частности, латентного семантического индексирования (LSI). Скажем, у меня есть который содержит частоты 5 слов для 7 документов.Aш о г д× до с у м е н тAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, …

2
История: роль статистики в астрономии
Недавно я смело заявил перед группой довольно умных учеников восьмого класса, что астрономия внесла большой вклад в основы статистики, и многие статистические концепции были изобретены для использования в астрономии. Однако, оглядываясь назад, я был довольно разочарован. Ошибки, среднее значение и среднее отклонение от среднего значения, возможно, впервые наблюдались в астрономии. …

1
Аддитивная или мультипликативная декомпозиция
Мой вопрос очень простой, но это те, которые действительно меня заводят :) Я не знаю, как оценить, нужно ли разложить определенный временной ряд, используя аддитивный или мультипликативный метод разложения. Я знаю, что есть визуальные подсказки, как отличить их друг от друга, но я их не понимаю. Возьмем, к примеру, этот …

1
Что такое CDF из двух выборок из и из одностороннего теста Колмогорова-Смирнова?
Я пытаюсь понять, как получить ppp для одностороннего теста Колмогорова-Смирнова , и пытаюсь найти CDF для D+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}} и D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}} в случае двух выборок. Ниже приводится в нескольких местах как CDF для D+nDn+D^{+}_{n} в случае с одним примером: p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - …

2
Почему корреляция рангов Пирсона действительна, несмотря на предположение о нормальности?
В настоящее время я читаю предположения о корреляциях Пирсона. Важным предположением для последующего t-критерия является то, что обе переменные происходят из нормальных распределений; если они этого не делают, то рекомендуется использовать альтернативные меры, такие как Spearman rho. Корреляция Спирмена вычисляется как корреляция Пирсона, используя только ранги X и Y вместо …

2
Оценка скорректированных коэффициентов риска в двоичных данных с использованием регрессии Пуассона
Я заинтересован в оценке скорректированного коэффициента риска, аналогичного тому, как оценивается скорректированный коэффициент шансов с использованием логистической регрессии. Некоторая литература (например, это ) указывает на то, что использование регрессии Пуассона со стандартными ошибками Губер-Уайта является основанным на модели способом сделать это Я не нашел литературы о том, как регулировка для …

1
Передискретизация с категориальными переменными
Я хотел бы выполнить комбинацию передискретизации и недостаточной выборки, чтобы сбалансировать мой набор данных примерно с 4000 клиентами, разделенными на две группы, где доля одной из групп составляет примерно 15%. Я изучил SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) и ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), но оба они создают новые синтетические образцы с …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.