Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Построение доверительных интервалов для прогнозируемых вероятностей из логистической регрессии
Хорошо, у меня есть логистическая регрессия, и я использовал predict()функцию для построения кривой вероятности на основе моих оценок. ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") Это здорово, но мне любопытно …

1
Какая польза от строки, созданной qqline () в R?
Функция qqnorm()R создает нормальный QQ-график и qqline()добавляет линию, которая проходит через первый и третий квартили. Каково происхождение этой линии? Полезно ли проверять нормальность? Это не классическая линия (диагональ возможно после линейного масштабирования).Y= хYзнак равноИксy=x Вот пример. Сначала я сравниваю эмпирическую функцию распределения с теоретической функцией распределения : теперь я строю …

2
Парный t-критерий как частный случай линейного смешанного моделирования
Мы знаем, что парное t- тестирование - это всего лишь частный случай одностороннего повторного измерения (или внутри субъекта) ANOVA, а также линейной модели смешанного эффекта, которую можно продемонстрировать с помощью функции lme () пакета nlme в R как показано ниже. #response data from 10 subjects under two conditions x1<-rnorm(10) x2<-1+rnorm(10) …

3
Можно ли интуитивно объяснить алгоритм MIC для обнаружения нелинейных корреляций?
Совсем недавно я прочитал две статьи. Первый - об истории корреляции, а второй - о новом методе, названном максимальным информационным коэффициентом (MIC). Мне нужна ваша помощь, чтобы понять метод MIC для оценки нелинейных корреляций между переменными. Более того, инструкции по его использованию в R можно найти на сайте автора (в …

3
Когда следует использовать множественную регрессию с фиктивным кодированием против ANCOVA?
Недавно я проанализировал эксперимент, который манипулировал 2 категориальными переменными и одной непрерывной переменной, используя ANCOVA. Однако рецензент предположил, что множественная регрессия с категориальной переменной, закодированной как фиктивная переменная, является более подходящим тестом для экспериментов как с категориальными, так и с непрерывными переменными. Когда целесообразно использовать ANCOVA против множественной регрессии с …

2
Построение линейной модели для соотношения в процентах?
Предположим, я хочу построить модель, чтобы предсказать какое-то соотношение или процент. Например, скажем, я хочу предсказать количество мальчиков и девочек, которые будут присутствовать на вечеринке, и особенности вечеринки, которые я могу использовать в модели, такие как количество рекламы для вечеринки, размер места проведения, есть ли будет ли алкоголь на вечеринке …

2
Порядок переменных в ANOVA имеет значение, не так ли?
Правильно ли я понимаю, что порядок, в котором переменные указываются в многофакторном ANOVA, имеет значение, но что порядок не имеет значения при выполнении множественной линейной регрессии? Таким образом, предполагая такой результат, как измеренная кровопотеря y и две категориальные переменные метод аденоидэктомии a , метод тонзиллэктомии b . Модель y~a+bотличается от …


1
Каковы основные компоненты в исследованиях ассоциаций всего генома?
В общегеномных ассоциативных исследованиях (GWAS): Каковы основные компоненты? Почему они используются? Как они рассчитываются? Можно ли провести исследование ассоциации всего генома без использования PCA?
20 pca  genetics  gwas 

4
Анализ выживания: непрерывное и дискретное время
Я не совсем понимаю, как решить, следует ли считать время непрерывным или дискретным в анализе выживания. В частности, я хочу использовать анализ выживаемости для определения переменных на уровне детей и домохозяйств, которые имеют наибольшее расхождение в их влиянии на выживаемость мальчиков и девочек (до 5 лет). У меня есть набор …
20 survival  ties 

3
Моменты раздачи - какое-нибудь использование для частичных или более высоких моментов?
Обычно используют второй, третий и четвертый моменты распределения для описания определенных свойств. Частичные моменты или моменты выше четвертого описывают какие-либо полезные свойства распределения?

7
Какие есть альтернативы боксу?
Я работаю над созданием веб-сайта, который отображает данные переписи для выбранных пользователем полигонов и хотел бы графически показать распределение различных параметров (по одному графику на параметр). Данные обычно имеют следующие свойства: Размер выборки, как правило, большой (скажем, около 10000 точек данных) Диапазон значений имеет тенденцию быть достаточно большим (например, минимальная …

9
Сколько лагов использовать в тесте Юнга-Бокса временного ряда?
После того, как модель ARMA подгоняется к временному ряду, обычно проверяют невязки с помощью теста Portmanteau Ljung-Box (среди других тестов). Тест Льюнга-Бокса возвращает значение ap. У него есть параметр h , который представляет собой количество тестируемых лагов. В некоторых текстах рекомендуется использовать h = 20; другие рекомендуют использовать h = …

6
Всегда сообщать о надежных (белых) стандартных ошибках?
Angrist и Pischke предположили, что устойчивые (то есть устойчивые к гетероскедастичности или неравные отклонения) стандартные ошибки сообщаются как нечто само собой разумеющееся, а не как их проверка. Два вопроса: Как это влияет на стандартные ошибки при этом, когда есть гомоскедастичность? Кто-нибудь на самом деле делает это в своей работе?

2
Оценщики максимального правдоподобия - многомерный гауссов
контекст Многомерный гауссов часто появляется в машинном обучении, и следующие результаты используются во многих книгах и курсах по ML без дериваций. Данные даны в виде матрицы измерений , если мы предположим, что данные следуют вариативному гауссовскому распределению с параметрами mean ( ) и ковариационной матрицей ( ) Оценки максимального правдоподобия …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.