Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Есть ли функциональная разница между соотношением шансов и коэффициентом опасности?
В логистической регрессии отношение шансов 2 означает, что событие в 2 раза более вероятно, учитывая увеличение на одну единицу предиктора. В регрессии Кокса коэффициент опасности 2 означает, что событие будет происходить в два раза чаще в каждый момент времени с учетом увеличения предиктора на одну единицу. Разве это не одно …

1
Как измерить достоверность консенсусного рейтинга (проблема из книги Кемени-Снелла)
Предположим, что каждому из экспертов поручено ранжировать набор из n объектов в порядке или предпочтении. Пусть разрешают связи в рейтингах.kkknnn Джон Кемени и Лори Снелл в своей книге 1962 года «Математические модели в социальных науках» предлагают решить следующую проблему: ПРОЕКТ . Разработайте показатель надежности консенсусного рейтинга k экспертами. Например, это …

3
Что лучше, STL или разложить?
Я делаю анализ временных рядов с использованием R. Я должен разложить свои данные на трендовую, сезонную и случайную составляющие. У меня есть еженедельные данные за 3 года. Я нашел две функции в R - stl()и decompose(). Я читал, что stl()это не хорошо для мультипликативного разложения. Кто-нибудь может сказать мне, в …
10 r  time-series 

2
Дисперсионно-ковариационная структура для случайных эффектов в lme4
Какова структура дисперсии-ковариации по умолчанию для случайных эффектов в glmerили lmerв lme4пакете? Как определить другую дисперсионно-ковариационную структуру для случайных эффектов в коде? Я не мог найти информацию об этом в lme4документации.

3
Является ли вычисление «фактической вероятности покрытия» таким же, как вычисление «вероятного интервала»?
Я читал учебник по статистике начального уровня. В главе, посвященной оценке максимального правдоподобия доли успеха в данных с биномиальным распределением, он дал формулу для расчета доверительного интервала, а затем упомянул небрежно Рассмотрим его фактическую вероятность покрытия, то есть вероятность того, что метод создает интервал, который фиксирует истинное значение параметра. Это …

3
Как получить p-значения коэффициентов из регрессии начальной загрузки?
Из Quick-R Роберта Кабакова у меня есть # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, …

3
Вероятность пересечения из нескольких выборок одной и той же популяции
Вот пример случая: У меня есть население 10000 предметов. Каждый элемент имеет уникальный идентификатор. Я случайно выбираю 100 предметов и записываю идентификаторы Я положил 100 предметов обратно в население Я снова выбираю 100 предметов, записываю идентификаторы и заменяю их. В общей сложности я повторяю эту случайную выборку 5 раз Какова …

4
Почему KNN не «на основе модели»?
Глава 2.4 ESL, по- видимому, классифицирует линейную регрессию как «основанную на модели», потому что она предполагает , тогда как для k-ближайших соседей подобная аппроксимация не указана. Но разве оба метода не делают предположений о ?f ( x )е( х ) ≈ х ⋅ βе(Икс)≈Икс⋅βf(x) \approx x\cdot\betaе( х )е(Икс)f(x) Позже в …

1
Сравнение пропорций с двумя выборками, оценка размера выборки: R против Stata
Сравнение пропорций с двумя выборками, оценка размера выборки: R против Stata Я получил разные результаты для размеров выборки, а именно: В R power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) Результат: (т. 161) для каждой группы.n = 160,7777Nзнак равно160.7777n = 160.7777 В стате sampsi 0.70 0.85, …

1
Могут ли случайные леса справиться с MNIST намного лучше, чем ошибка тестирования 2,8%?
Я не нашел никакой литературы по применению случайных лесов к MNIST, CIFAR, STL-10 и т. Д., Поэтому я решил попробовать их с MNIST, не зависящим от перестановок . В R я попробовал: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Это работало в течение 2 часов и получило 2,8% ошибок теста. Я также …

1
Является ли насыщенная модель частным случаем переоборудованной модели?
Я пытаюсь понять, что такое насыщенная модель. AFAIK это когда у тебя столько функций, сколько наблюдений. Можно ли сказать, что насыщенная модель является частным случаем чрезвычайно переоснащенной модели?

2
Классификатор только для одного класса
В простой классификации у нас есть два класса: класс-0 и класс-1. В некоторых данных у меня есть только значения для класса-1, поэтому нет для класса-0. Сейчас я думаю о создании модели для моделирования данных для класса 1. Таким образом, когда поступают новые данные, эта модель применяется к новым данным и …

2
Тест независимости против теста гомогенности
Я преподаю базовый курс статистики, и сегодня я рассмотрю критерий независимости по критерию хи-квадрат для двух категорий и критерий однородности. Эти два сценария концептуально различны, но могут использовать одну и ту же статистику теста и распределение. В тесте на однородность предполагается, что предельные итоги для одной из категорий являются частью …


3
Обобщенные линейные смешанные модели: выбор модели
Этот вопрос / тема возникла в дискуссии с коллегой, и я искал несколько мнений по этому поводу: Я моделирую некоторые данные, используя логистическую регрессию со случайными эффектами, точнее - логистическую регрессию со случайным перехватом. Для фиксированных эффектов у меня есть 9 переменных, которые представляют интерес и учитываются. Я хотел бы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.