Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Является ли справедливая идентификация 2SLS несмещенной?
В книге « В основном безвредная эконометрика: спутник эмпирика» (Angrist and Pischke, 2009: стр. 209) я прочитал следующее: (...) На самом деле, только что идентифицированный 2SLS (скажем, простой оценщик Вальда) примерно беспристрастен . Это трудно показать формально, потому что только что идентифицированный 2SLS не имеет моментов (то есть, распределение выборки …

2
Есть ли обстоятельства, в которых следует использовать ступенчатую регрессию?
В прошлом поэтапная регрессия использовалась во многих биомедицинских работах, но, похоже, она улучшается благодаря лучшему пониманию многих ее проблем. Однако многие старые рецензенты все еще просят об этом. В каких обстоятельствах ступенчатая регрессия играет свою роль и должна использоваться, если таковая имеется?

1
Является ли оценка MLE асимптотически нормальной и эффективной, даже если модель неверна?
Предпосылка: это может быть глупый вопрос. Я знаю только утверждения об асимптотических свойствах MLE, но я никогда не изучал доказательства. Если бы я это сделал, возможно, я бы не стал задавать эти вопросы, или, может быть, я бы понял, что эти вопросы не имеют смысла ... поэтому, пожалуйста, будьте осторожны …

1
AIC регрессии гребня: степени свободы в зависимости от количества параметров
Я хочу рассчитать AICc модели регрессии гребня. Проблема в количестве параметров. Для линейной регрессии большинство людей предполагают, что число параметров равно количеству оценочных коэффициентов плюс сигма (дисперсия ошибки). Когда дело доходит до регрессии гребня, я читал, что след матрицы шляп - степень свободы (df) - просто используется как число параметров …

1
Как найти 95% вероятный интервал?
Я пытаюсь вычислить 95% вероятный интервал следующего апостериорного распределения. Я не смог найти функцию в R для нее, но правильный ли подход ниже? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, 0.11, 0.07, 0.02, 0.009, 0.005, …

1
Можете ли вы дать простое интуитивное объяснение метода IRLS, чтобы найти MLE GLM?
Фон: Я пытаюсь следовать обзору Принстона оценки MLE для GLM . Я понимаю основы оценки MLE: likelihood, score, наблюдаемая и ожидаемая Fisher informationи Fisher scoringтехника. И я знаю, как обосновать простую линейную регрессию с помощью оценки MLE . Вопрос: Я не могу понять даже первую строку этого метода :( Что …

1
Как сравнить модели на основе AIC?
У нас есть две модели, которые используют один и тот же метод для вычисления логарифмической вероятности, и AIC для одной ниже, чем другой. Тем не менее, тот с более низким AIC интерпретировать гораздо сложнее. У нас возникают проблемы с принятием решения, стоит ли вводить сложность, и мы судили об этом, …

1
Почему в ecdf используется пошаговая функция, а не линейная интерполяция?
Эмпирические функции CDF обычно оцениваются пошаговой функцией. Есть ли причина, почему это делается таким образом, а не с помощью линейной интерполяции? Есть ли у функции шага какие-нибудь интересные теоретические свойства, которые заставляют нас предпочитать ее? Вот пример из двух: ecdf2 <- function (x) { x <- sort(x) n <- length(x) …
13 r  distributions  ecdf 

1
Пакет GBM против Карет с использованием GBM
Я занимался настройкой модели caret, но затем перезапустил модель, используя gbmпакет. Насколько я понимаю, caretпакет использует gbmи вывод должен быть одинаковым. Тем не менее, только быстрый запуск теста data(iris)показывает несоответствие в модели около 5% с использованием RMSE и R ^ 2 в качестве метрики оценки. Я хочу найти оптимальную производительность …

2
Ковариационные функции или ядра - что это такое?
Я довольно новичок в области гауссовских процессов и того, как они применяются в машинном обучении. Я продолжаю читать и слышать о ковариационных функциях, являющихся главной привлекательностью этих методов. Так может ли кто-нибудь объяснить интуитивно, что происходит в этих ковариационных функциях? В противном случае, если бы вы могли указать на конкретное …

2
Почему отсечение P> 0,5 не является «оптимальным» для логистической регрессии?
ПРЕДИСЛОВИЕ: Меня не волнуют преимущества использования отсечки или нет, или как выбрать отсечение. Мой вопрос чисто математический и из любопытства. Логистическая регрессия моделирует апостериорную условную вероятность класса A по сравнению с классом B, и она соответствует гиперплоскости, где апостериорные условные вероятности равны. Таким образом, в теории я понял, что точка …


1
Совместно полная достаточная статистика: равномерная (a, b)
Пусть X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n) - случайная выборка из равномерного распределения на (a,b)(a,b)(a,b) , где a&lt;ba&lt;ba < b . Пусть Y1Y1Y_1 и YnYnY_n будут статистикой наибольшего и наименьшего порядка. Покажите, что статистика (Y1,Yn)(Y1,Yn)(Y_1, Y_n) является совместно полной достаточной статистикой для параметра θ=(a,b)θ=(a,b)\theta = (a, b), Для меня не проблема …

2
Как определить область отказа, когда нет UMP?
Рассмотрим модель линейной регрессии ,y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} ,u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) .E(u∣X)=0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} Пусть против H 1 : σ 2 0 ≠ σ 2 .H0:σ20=σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1:σ20≠σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 Мы можем сделать вывод, что , гдеdim(X)=n×k. ИМХявляется типичным для обозначения матрицы аннуляторного,МXу= у , где у является зависимой переменнойурегрессировали наX.yTMXyσ2∼χ2(n−k)yTMXyσ2∼χ2(n−k)\frac{\mathbf{y}^T\mathbf{M_X}\mathbf{y}}{\sigma^2}\sim \chi^2(n-k)dim(X)=n×kdim(X)=n×kdim(\mathbf{X})=n\times kMXMX\mathbf{M_X}MXy=y^MXy=y^\mathbf{M_X}\mathbf{y}=\hat{\mathbf{y}}y^y^ \hat{\mathbf{y}}yy\mathbf{y}XX\mathbf{X} Книга, которую я читаю, …

3
Простая линейная регрессия, p-значения и AIC
Я понимаю, что эта тема поднималась несколько раз, например, здесь , но я все еще не уверен, как лучше интерпретировать мой результат регрессии. У меня есть очень простой набор данных, состоящий из столбца значений x и столбца значений y , разделенных на две группы в зависимости от местоположения (loc). Точки …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.