Как стандартные ошибки коэффициентов рассчитываются в регрессии?

115

Для моего собственного понимания я заинтересован в том, чтобы вручную повторить вычисление стандартных ошибок оценочных коэффициентов, поскольку, например, они поставляются с выходными данными lm()функции R, но не смогли ее определить. Какая формула / реализация используется?

— АКО
источник

Хороший вопрос, многие знают регрессию с точки зрения линейной алгебры, где вы решаете линейное уравнение и получаете ответ для бета-версии. Непонятно, почему у нас есть стандартная ошибка и предположение за этим.

X^{'} X β = X^{'} y

$X'X\beta=X'y$

— Haitao Du

Ответы:

123

Линейная модель записывается как где обозначает вектор ответов, - вектор параметров фиксированных эффектов, - соответствующая матрица дизайна, столбцы которой являются значениями объясняющих переменных, и - вектор случайных ошибок.

| \begin{array}{l} y = X β + ϵ \\ ϵ \sim N (0, σ^{2} I), \end{array}

$\left| \begin{array}{l} \mathbf{y} = \mathbf{X} \mathbf{\beta} + \mathbf{\epsilon} \\ \mathbf{\epsilon} \sim N(0, \sigma^2 \mathbf{I}), \end{array} \right.$

y

$\mathbf{y}$

β

$\mathbf{\beta}$

X

$\mathbf{X}$

ϵ

$\mathbf{\epsilon}$

Хорошо известно, что оценка дается (см., Например, статью в Википедии ) Следовательно, [напоминание: для некоторого случайного вектора и некоторой неслучайной матрицы ] $\mathbf{\beta}$

\hat{β} = (X^{'} X)^{- 1} X^{'} y .

$\hat{\mathbf{\beta}} = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{y}.$

Var (\hat{β}) = (X^{'} X)^{- 1} X^{'} σ^{2} I X (X^{'} X)^{- 1} = σ^{2} (X^{'} X)^{- 1},

$\textrm{Var}(\hat{\mathbf{\beta}}) = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \;\sigma^2 \mathbf{I} \; \mathbf{X} (\mathbf{X}^{\prime} \mathbf{X})^{-1} = \sigma^2 (\mathbf{X}^{\prime} \mathbf{X})^{-1},$

Var (A X) = A \times Var (X) \times A'

$\textrm{Var}(AX)=A\times \textrm{Var}(X) \times A′$

X

$X$

A

$A$

так что где можно получить с помощью ошибки среднего квадрата (MSE) в таблице ANOVA.

\hat{Var} (\hat{β}) = {\hat{σ}}^{2} (X^{'} X)^{- 1},

$\widehat{\textrm{Var}}(\hat{\mathbf{\beta}}) = \hat{\sigma}^2 (\mathbf{X}^{\prime} \mathbf{X})^{-1},$

{\hat{σ}}^{2}

$\hat{\sigma}^2$

Пример с простой линейной регрессией в R

#------generate one data set with epsilon ~ N(0, 0.25)------
seed <- 1152 #seed
n <- 100     #nb of observations
a <- 5       #intercept
b <- 2.7     #slope

set.seed(seed)
epsilon <- rnorm(n, mean=0, sd=sqrt(0.25))
x <- sample(x=c(0, 1), size=n, replace=TRUE)
y <- a + b * x + epsilon
#-----------------------------------------------------------

#------using lm------
mod <- lm(y ~ x)
#--------------------

#------using the explicit formulas------
X <- cbind(1, x)
betaHat <- solve(t(X) %*% X) %*% t(X) %*% y
var_betaHat <- anova(mod)[[3]][2] * solve(t(X) %*% X)
#---------------------------------------

#------comparison------
#estimate
> mod$coef
(Intercept)           x 
   5.020261    2.755577 

> c(betaHat[1], betaHat[2])
[1] 5.020261 2.755577

#standard error
> summary(mod)$coefficients[, 2]
(Intercept)           x 
 0.06596021  0.09725302 

> sqrt(diag(var_betaHat))
                    x 
0.06596021 0.09725302 
#----------------------

Когда есть одна объясняющая переменная, модель сводится к и чтобы и формулы становятся более прозрачными. Например, стандартная ошибка предполагаемого уклона:

y_{i} = a + b x_{i} + ϵ_{i}, i = 1, \dots, n

$y_i = a + bx_i + \epsilon_i, \qquad i = 1, \dotsc, n$

X = (\begin{array}{cc} 1 & x_{1} \\ 1 & x_{2} \\ ⋮ & ⋮ \\ 1 & x_{n} \end{array}), β = (\begin{matrix} a \\ b \end{matrix})

$\mathbf{X} = \left( \begin{array}{cc} 1 & x_1 \\ 1 & x_2 \\ \vdots & \vdots \\ 1 & x_n \end{array} \right), \qquad \mathbf{\beta} = \left( \begin{array}{c} a\\b \end{array} \right)$

(X^{'} X)^{- 1} = \frac{1}{n \sum x_{i}^{2} - (\sum x_{i})^{2}} (\begin{array}{cc} \sum x_{i}^{2} & - \sum x_{i} \\ - \sum x_{i} & n \end{array})

$(\mathbf{X}^{\prime} \mathbf{X})^{-1} = \frac{1}{n\sum x_i^2 - (\sum x_i)^2} \left( \begin{array}{cc} \sum x_i^2 & -\sum x_i \\ -\sum x_i & n \end{array} \right)$

\sqrt{\hat{Var} (\hat{b})} = \sqrt{[{\hat{σ}}^{2} (X^{'} X)^{- 1}]_{22}} = \sqrt{\frac{n {\hat{σ}}^{2}}{n \sum x_{i}^{2} - (\sum x_{i})^{2}}} .

$\sqrt{\widehat{\textrm{Var}}(\hat{b})} = \sqrt{[\hat{\sigma}^2 (\mathbf{X}^{\prime} \mathbf{X})^{-1}]_{22}} = \sqrt{\frac{n \hat{\sigma}^2}{n\sum x_i^2 - (\sum x_i)^2}}.$

> num <- n * anova(mod)[[3]][2]
> denom <- n * sum(x^2) - sum(x)^2
> sqrt(num / denom)
[1] 0.09725302

— ocram
источник

Спасибо за подробный ответ. Итак, я так понимаю, последняя формула не выполняется в многомерном случае?

— АКО

Нет, самая последняя формула работает только для конкретной X-матрицы простой линейной модели. В многомерном случае вы должны использовать общую формулу, приведенную выше.

— Октябрь

+1, быстрый вопрос, как получается ?

V a r (\hat{β})

$Var(\hat\beta)$

— Авокадо

@loganecolss: Он исходит из того , что для некоторого случайного вектора и некоторой неслучайной матрицы .

Var (A X) = A Var(X) A^{'}

$\text{Var}(AX)=A\text{Var(X)}A'$

X

$X$

A

$A$

— октября

обратите внимание, что это правильные ответы для ручного расчета, но фактическая реализация, используемая в lm.fit/ summary.lmнемного отличается, для стабильности и эффективности ...

— Бен Болкер,

Формулы для них можно найти в любом промежуточном тексте по статистике, в частности, вы можете найти их в Sheather (2009, глава 5) , откуда также взято следующее упражнение (стр. 138).

Следующий код R вычисляет оценки коэффициентов и их стандартные ошибки вручную

dfData <- as.data.frame(
  read.csv("http://www.stat.tamu.edu/~sheather/book/docs/datasets/MichelinNY.csv",
                   header=T))

# using direct calculations
vY <- as.matrix(dfData[, -2])[, 5]                        # dependent variable
mX <- cbind(constant = 1, as.matrix(dfData[, -2])[, -5])  # design matrix

vBeta <- solve(t(mX)%*%mX, t(mX)%*%vY)                    # coefficient estimates
dSigmaSq <- sum((vY - mX%*%vBeta)^2)/(nrow(mX)-ncol(mX))  # estimate of sigma-squared
mVarCovar <- dSigmaSq*chol2inv(chol(t(mX)%*%mX))          # variance covariance matrix
vStdErr <- sqrt(diag(mVarCovar))                          # coeff. est. standard errors
print(cbind(vBeta, vStdErr))                              # output

который производит вывод

                         vStdErr
constant   -57.6003854 9.2336793
InMichelin   1.9931416 2.6357441
Food         0.2006282 0.6682711
Decor        2.2048571 0.3929987
Service      3.0597698 0.5705031

Сравните с выводом из lm():

# using lm()
names(dfData)
summary(lm(Price ~ InMichelin + Food + Decor + Service, data = dfData))

который производит вывод:

Call:
lm(formula = Price ~ InMichelin + Food + Decor + Service, data = dfData)

Residuals:
    Min      1Q  Median      3Q     Max 
-20.898  -5.835  -0.755   3.457 105.785 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)    
(Intercept) -57.6004     9.2337  -6.238 3.84e-09 ***
InMichelin    1.9931     2.6357   0.756    0.451    
Food          0.2006     0.6683   0.300    0.764    
Decor         2.2049     0.3930   5.610 8.76e-08 ***
Service       3.0598     0.5705   5.363 2.84e-07 ***
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 

Residual standard error: 13.55 on 159 degrees of freedom
Multiple R-squared: 0.6344, Adjusted R-squared: 0.6252 
F-statistic: 68.98 on 4 and 159 DF,  p-value: < 2.2e-16

— tchakravarty
источник

Хороший трюк с solve()функцией. Это было бы немного дольше без матричной алгебры. Есть ли краткий способ выполнения этой конкретной строки только с базовыми операторами?

— АКО

@AkselO Для оценки OLS существует хорошо известное выражение в закрытой форме, , который можно вычислить, явно вычислив обратную матрицу ( (как это сделал @ ocram), но это сложно сделать с плохо обусловленными матрицами.

\hat{β} = (X^{'} X)^{- 1} X Y

$\widehat{\boldsymbol{\beta}} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}\boldsymbol{Y}$

(X^{'} X)

$(\mathbf{X}'\mathbf{X})$

— Чакраварти

Часть ответа Окрама неверна. Фактически:

$\hat{\mathbf{\beta}} = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{y} - (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{\epsilon}.$

$E(\hat{\mathbf{\beta}}) = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{y}.$

А комментарий к первому ответу показывает, что требуется более подробное объяснение дисперсии коэффициента:

$\textrm{Var}(\hat{\mathbf{\beta}}) = E(\hat{\mathbf{\beta}}-E(\hat{\mathbf{\beta}}))^2=\textrm{Var}(- (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{\epsilon}) =(\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \;\sigma^2 \mathbf{I} \; \mathbf{X} (\mathbf{X}^{\prime} \mathbf{X})^{-1} = \sigma^2 (\mathbf{X}^{\prime} \mathbf{X})^{-1}$

редактировать

Спасибо, я проигнорировал шляпу в этой бета-версии. Вышеприведенный вывод . Правильный результат: $\mathbf{wrongly}$ $\mathbf{wrong}$

1.(Чтобы получить это уравнение, установите производную первого порядка от в равную нулю, для максимизации ) $\hat{\mathbf{\beta}} = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{y}.$ $\mathbf{SSR}$ $\mathbf{\beta}$ $\mathbf{SSR}$

2. $E(\hat{\mathbf{\beta}}|\mathbf{X}) = E((\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} (\mathbf{X}\mathbf{\beta}+\mathbf{\epsilon})|\mathbf{X}) = \mathbf{\beta} + ((\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime})E(\mathbf{\epsilon}|\mathbf{X}) = \mathbf{\beta}.$

3. $\textrm{Var}(\hat{\mathbf{\beta}}) = E(\hat{\mathbf{\beta}}-E(\hat{\mathbf{\beta}}|\mathbf{X}))^2=\textrm{Var}((\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{\epsilon}) =(\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \;\sigma^2 \mathbf{I} \; \mathbf{X} (\mathbf{X}^{\prime} \mathbf{X})^{-1} = \sigma^2 (\mathbf{X}^{\prime} \mathbf{X})^{-1}$

Надеюсь, это поможет.

— Линже Не
источник

Вывод оценки OLS для бета-вектора, , можно найти в любом учебнике по достойной регрессии. В свете этого, можете ли вы предоставить доказательство того, что это должно быть вместо?

\hat{β} = (X^{'} X)^{- 1} X^{'} Y

$\hat{\boldsymbol \beta} = ({\bf X'X})^{-1}{\bf X'Y}$

\hat{β} = (X^{'} X)^{- 1} X^{'} y - (X^{'} X)^{- 1} X^{'} ϵ

$\hat{\mathbf{\beta}} = (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{y} - (\mathbf{X}^{\prime} \mathbf{X})^{-1} \mathbf{X}^{\prime} \mathbf{\epsilon}$

— Кун

Ваша даже не оценщик, потому что не наблюдается!

\hat{β}

$\hat\beta$

ϵ

$\epsilon$

— whuber

Это также можно посмотреть в этом видео: youtube.com/watch?v=jyBtfhQsf44

— StatsStudent