13. Régression linéaire simple
193
et
β 0 = mean(Y ) − β 1 · mean(X).
La droite de régression est par ailleurs la droite pour laquelle la variable résiduelle ε = Y − β 0 − β 1 X est de moyenne nulle et de variance minimale. On a
ainsi mean(ε) = 0, alors que variance(ε) est minimisé. On notera à nouveau
le lien entre le coefficient de corrélation et la pente de la droite de régression :
correlation(X, Y ) = β 1 ·
variance(X)
variance(Y )
.
13.3 Variance prédite et variance résiduelle
On peut décomposer une variable Y en une somme de deux termes :
Y = (β 0 + β 1 X) + ε.
Le premier terme β 0 + β 1 X représente la droite de régression, aussi appelée
meilleur prédicteur linéaire de Y à partir de X. Le second terme ε représente
l’erreur de prédiction, aussi appelée variable résiduelle. Or, l’erreur de prédiction se trouve être non corrélée avec le prédicteur. On a en effet :
covariance(X, ε) = covariance(X, Y − β 0 − β 1 X)
= covariance(X, Y ) − β 1 · variance(X)
= covariance(X, Y ) −
covariance(X, Y )
variance(X)
· variance(X)
= 0.
Il s’ensuit :
variance(Y ) = variance(β 0 + β 1 X + ε)
= variance(β 0 + β 1 X) + variance(ε) + 2β 1 · covariance(X, ε)
= variance(β 0 + β 1 X) + variance(ε).
Il s’agit d’un nouveau résultat fondamental de la statistique que l’on aura plaisir
à encadrer :
et X la réponse), on obtiendrait une droite de régression avec paramètres donnés par :
β
1 =
covariance(X, Y )
variance(Y )
ainsi que :
β
0 = mean(X) − β
1 · mean(Y )
qui seront différents des paramètres β 0 et β 1 (sauf si X et Y ont la même moyenne et la
même variance, auquel cas ils seront identiques).
Précédent

- 202/327

Suivant