192
Statistique appliquée aux sciences de la vie
13.2 Droite de régression sur la population
Dans la section précédente, on a utilisé des chapeaux pour désigner les
coefficients de la droite de régression car ils étaient calculés à partir des données
de l’échantillon. Rappelons toutefois que notre intérêt n’est pas l’échantillon,
mais toute la population de laquelle provient notre échantillon. Si on connaissait
la taille et le poids de tous les individus de notre population, on pourrait en
effet calculer une droite de régression sur cette population, en utilisant le même
critère des moindres carrés. Cette droite théorique représenterait la « véritable
droite de régression ». Comme d’habitude, la droite de régression
y
∗ =
β 0 +
β 1 x
calculée sur notre échantillon sera une estimation de la véritable droite de
régression définie sur la population, que nous noterons par y
∗ = β 0 + β 1 x.
Il est important de noter que même si on connaissait les véritables paramètres β 0 et β 1 de la véritable droite de régression, et que l’on utilisait cette
droite pour faire des prédictions, on ferait quand même des erreurs de prédiction (la relation entre la taille et le poids, qui n’est pas exacte dans notre
échantillon, ne sera pas non plus exacte dans la population). Si on utilisait la
véritable droite de régression pour faire des prédictions, la prédiction que l’on
ferait pour le i-ième individu serait donnée par :
y
∗
i = β 0 + β 1 x i
et on aurait ainsi l’erreur de prédiction suivante :
ε i = y i − y
∗
i = y i − β 0 − β 1 x i .
Or, cette « véritable erreur de prédiction » ε i ne peut pas être observée dans
notre échantillon. L’erreur de prédiction
ε i que nous calculons dans notre échantillon pour le i-ième individu :
ε i = y i −
y
∗
i = y i −
β 0 −
β 1 x i
n’est donc qu’une « estimation » de la véritable erreur se prédiction ε i . Contrairement au poids Y ou à la taille X, la variable que l’on appelle variable résiduelle
définie par :
ε = Y − β 0 − β 1 X
et qui représente « l’erreur de prédiction que l’on ferait si on connaissait la
véritable droite de régression », est une variable non observable car elle dépend
de paramètres β 0 et β 1 qui sont eux-mêmes inconnus.
La droite de régression définie sur la population a des propriétés similaires
à la droite de régression calculée dans notre échantillon. On a ainsi
3 :
β 1 =
covariance(X, Y )
variance(X)
3 On rappellera à cette occasion que la régression n’est pas un concept symétrique des
variables X et Y . Les paramètres β 0 et β 1 de la droite de régression ci-dessus sont définis
avec X comme prédicteur et Y comme réponse. Si on inversait les rôles (si Y était le prédicteur
Statistique appliquée aux sciences de la vie
13.2 Droite de régression sur la population
Dans la section précédente, on a utilisé des chapeaux pour désigner les
coefficients de la droite de régression car ils étaient calculés à partir des données
de l’échantillon. Rappelons toutefois que notre intérêt n’est pas l’échantillon,
mais toute la population de laquelle provient notre échantillon. Si on connaissait
la taille et le poids de tous les individus de notre population, on pourrait en
effet calculer une droite de régression sur cette population, en utilisant le même
critère des moindres carrés. Cette droite théorique représenterait la « véritable
droite de régression ». Comme d’habitude, la droite de régression
y
∗ =
β 0 +
β 1 x
calculée sur notre échantillon sera une estimation de la véritable droite de
régression définie sur la population, que nous noterons par y
∗ = β 0 + β 1 x.
Il est important de noter que même si on connaissait les véritables paramètres β 0 et β 1 de la véritable droite de régression, et que l’on utilisait cette
droite pour faire des prédictions, on ferait quand même des erreurs de prédiction (la relation entre la taille et le poids, qui n’est pas exacte dans notre
échantillon, ne sera pas non plus exacte dans la population). Si on utilisait la
véritable droite de régression pour faire des prédictions, la prédiction que l’on
ferait pour le i-ième individu serait donnée par :
y
∗
i = β 0 + β 1 x i
et on aurait ainsi l’erreur de prédiction suivante :
ε i = y i − y
∗
i = y i − β 0 − β 1 x i .
Or, cette « véritable erreur de prédiction » ε i ne peut pas être observée dans
notre échantillon. L’erreur de prédiction
ε i que nous calculons dans notre échantillon pour le i-ième individu :
ε i = y i −
y
∗
i = y i −
β 0 −
β 1 x i
n’est donc qu’une « estimation » de la véritable erreur se prédiction ε i . Contrairement au poids Y ou à la taille X, la variable que l’on appelle variable résiduelle
définie par :
ε = Y − β 0 − β 1 X
et qui représente « l’erreur de prédiction que l’on ferait si on connaissait la
véritable droite de régression », est une variable non observable car elle dépend
de paramètres β 0 et β 1 qui sont eux-mêmes inconnus.
La droite de régression définie sur la population a des propriétés similaires
à la droite de régression calculée dans notre échantillon. On a ainsi
3 :
β 1 =
covariance(X, Y )
variance(X)
3 On rappellera à cette occasion que la régression n’est pas un concept symétrique des
variables X et Y . Les paramètres β 0 et β 1 de la droite de régression ci-dessus sont définis
avec X comme prédicteur et Y comme réponse. Si on inversait les rôles (si Y était le prédicteur
