Линейная регрессия: * Почему * вы можете разделить суммы квадратов?


9

Этот пост относится к двумерной модели линейной регрессии, . Я всегда брал разбиение общей суммы квадратов (SSTO) на сумму квадратов для ошибки (SSE) и суммы квадратов для модели (SSR) по вере, но как только я действительно начал думать об этом, я не понимаю почему это работает ...Yi=β0+β1xi

Часть I действительно понимают:

yi : наблюдаемое значение y

y¯ : среднее значение всех наблюдаемых syi

y^i : подогнанное / предсказанное значение y для данного наблюдения x

yi−y^i : Остаток / ошибка (если возвести в квадрат и сложить для всех наблюдений, это SSE)

y^i−y¯ : насколько значение, соответствующее модели, отличается от среднего значения (если в квадрате и суммировать для всех наблюдений, это SSR)

yi−y¯ : насколько наблюдаемое значение отличается от среднего значения (если суммировать и суммировать для всех наблюдений, это SSTO).

Я могу понять, почему, для одного наблюдения, ничего не возводя в квадрат, . И я могу понять, почему, если вы хотите сложить вещи по всем наблюдениям, вы должны возвести их в квадрат, или они сложат до 0.(yi−y¯)=(y^i−y¯)+(yi−y^i)

Я не понимаю, почему (например, SSTO = SSR + SSE). Похоже, что если у вас есть ситуация, когда , то , а не . Почему это не так? = В + С 2 = B 2 + 2 В С + С 2 2 = B 2 + C 2(yi−y¯)2=(y^i−y¯)2+(yi−y^i)2A=B+CA2=B2+2BC+C2A2=B2+C2


5
Вы пропустили суммирование в вашем последнем абзаце. SST = SSR + SSE - это сумма по , но ваше равенство, которое вы написали непосредственно перед тем, как оно на самом деле неверно без знака суммирования. i
— Glen_b

1
В вашем последнем абзаце вы хотите (т.е. SSTO = SSR + SSE) нет (например, SSTO = SSR + SSE). «eg» - это сокращение от латинской фразы « examplesli gratia » или «например» на английском языке. «ie» является аббревиатурой от « id est » и может читаться на английском языке как «то есть».
— Мэтью Ганн

Ответы:


9

Похоже, что если у вас есть ситуация, когда , то A 2 = B 2 + 2 B C + C 2 , а не A 2 = B 2 + C 2 . Почему это не так?A=B+CA2=B2+2BC+C2A2=B2+C2

Концептуально идея состоит в том, что потому что B и C ортогональны (то есть перпендикулярны).BC=0BC


В контексте линейной регрессии здесь, невязки ортогональны унижал прогноз у я - ˉ у . Прогноз от линейной регрессии создает ортогональное разложение y в том же смысле, что ( 3 , 4 ) = ( 3 , 0 ) + ( 0 , 4 ) является ортогональным разложением.ϵi=yi−y^iy^i−y¯y(3,4)=(3,0)+(0,4)

Версия линейной алгебры:

Позволять:

z=[y1−y¯y2−y¯…yn−y¯]z^=[y^1−y¯y^2−y¯…y^n−y¯]ϵ=[y1−y^1y2−y^2…yn−y^n]=z−z^

Линейная регрессия (с включенной константой) разбивает на сумму двух векторов: прогноз и остаточныйz εz^ϵ

z=z^+ϵ

Пусть обозначает скалярное произведение . (В более общем смысле может быть внутренним произведением .)⟨ X⟨.,.⟩Е [ Х Y ]⟨X,Y⟩ E[XY]

⟨z,z⟩=⟨z^+ϵ,z^+ϵ⟩=⟨z^,z^⟩+2⟨z^,ϵ⟩+⟨ϵ,ϵ⟩=⟨z^,z^⟩+⟨ϵ,ϵ⟩

Где последняя строка следует из того факта, что (т. Е. Это и ортогональны). Вы можете доказать, что и ортогональны, основываясь на том, как обычная регрессия наименьших квадратов строит .г & epsi ; = г - г г & epsi ; г⟨z^,ϵ⟩=0z^ϵ=z−z^z^ϵz^

гх1х2ε г х1х2εz^ является линейной проекцией из на подпространство , определенное линейной оболочкой из регрессоры , , и т.д .... Остаточный ортогонален всему этому подпространству, поэтому (который находится в диапазоне , и т. д. ...) ортогональный .zx1x2ϵz^x1x2ϵ


Обратите внимание, что как я определил как скалярное произведение, - просто еще один способ написания (т. е. SSTO = SSR + SSE)⟨ Г , г ⟩ = ⟨ г , г ⟩ + ⟨ & epsi ; , & epsi ; ⟩ Е я ( у я - ˉ у ) 2 = Е я ( у я - ˉ у ) 2 + Е я ( у я - у и ) 2⟨.,.⟩⟨z,z⟩=⟨z^,z^⟩+⟨ϵ,ϵ⟩∑i(yi−y¯)2=∑i(y^i−y¯)2+∑i(yi−y^i)2


8

Весь смысл в том, что некоторые векторы ортогональны, а затем используют теорему Пифагора.

Рассмотрим многомерную линейную регрессию . Мы знаем, что оценщик OLS равен . Теперь рассмотрим оценку& beta ; = ( Х т Х ) - 1 х т УY=Xβ+ϵβ^=(XtX)−1XtY

Y^=Xβ^=X(XtX)−1XtY=HY (матрица H также называется "шляпной" матрицей)

где - ортогональная проекционная матрица Y на . Теперь у нас естьS ( X )HS(X)

Y−Y^=Y−HY=(I−H)Y

где - матрица проекции на ортогональное дополнение которое является . Таким образом, мы знаем, что и ортогональны.S ( X ) S ⊥ ( X ) Y - Y(I−H)S(X)S⊥(X)Y−Y^Y^

Теперь рассмотрим подмодельY=X0β0+ϵ

где и аналогично у нас есть оценщик OLS и оценка и с матрицей проекции на . Точно так же у нас есть и ортогональны. И сейчас^ β 0 ^ Y 0 H 0 S ( X 0 ) Y - ^ Y 0 ^ Y 0X=[X0|X1]β0^Y0^H0S(X0)Y−Y0^Y0^

Y^−Y0^=HY−H0Y=HY−H0HY=(I−H0)HY

где снова - матрица ортогональной проекции на дополнении к которое является . Таким образом, мы имеем ортогональность и . Итак, в конце концов мы имеемС ( Х 0 ) S ⊥ ( Х 0 ) У - ^ У 0 ^ У 0(I−H0)S(X0)S⊥(X0)Y^−Y0^Y0^

||Y−Y^||2=||Y||2−||Y^||2=||Y−Y0^||2+||Y0^||2−||Y^−Y0^||2−||Y0^||2

и, наконец,||Y−Y0^||2=||Y−Y^||2+||Y^−Y0^||2

Наконец, среднее значение - это просто при рассмотрении нулевой модели .Y¯Y0^Y=β0+e


Спасибо за ваш ответ! Что такое S () (как в S (X) в вашем посте)?
— Bluemouse

S(X) - подпространство, порожденное столбцами матрицыX
— Лукаш Град,
Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.