13. Régression linéaire simple
197
• le poids moyen du groupe du 7
e individu (ceux mesurant 157 cm) est
estimé à 59.0 kg ; avec ses 64.0 kg, cet individu pèse donc 5.0 kg de plus
que la moyenne de son groupe.
Ainsi, bien que le 6
e individu soit plus lourd que le 7
e (poids de 68.9 kg contre
64.0 kg), il sera considéré comme moins lourd si on ajuste le poids pour la taille
(poids ajusté pour la taille de +4.8 kg contre +5.0 kg).
Une façon équivalente de définir l’hypothèse de linéarité est la suivante :
mean(ε|X = x) = mean(Y − β 0 − β 1 X|X = x)
= mean(Y |X = x) − mean(β 0 + β 1 X|X = x)
= β 0 + β 1 x − (β 0 + β 1 x)
= 0.
On a vu que l’on a de toute façon mean(ε) = 0 (que l’hypothèse de linéarité soit
satisfaite ou non). Avec l’hypothèse de linéarité, on aura en plus mean(ε|X =
x) = 0 quelle que soit la valeur de x. Ainsi, les erreurs de prédiction ne seront
pas seulement nulles en moyenne globalement, mais aussi nulles en moyenne
localement (c’est-à-dire dans chaque groupe défini par X = x). Dans notre
exemple, cela veut dire que les erreurs de prédiction seront en moyenne nulles
dans le groupe des individus mesurant 160 cm, dans le groupe des 165 cm, dans
le groupe des 170 cm, dans le groupe des 171.23 cm, etc.
Comme son nom l’indique, l’hypothèse de linéarité est une hypothèse, qui
selon les cas sera raisonnable ou non raisonnable, et qu’il s’agira de vérifier,
par exemple graphiquement. On vérifiera ainsi que la droite de régression passe
bien au milieu des points représentant les données non seulement globalement,
mais aussi localement. Comme on l’a dit pour la normalité, l’hypothèse de
linéarité est cependant un concept théorique. En pratique, l’hypothèse de linéarité ne sera jamais vraie au sens strict du terme, mais pourra constituer une
bonne approximation de la réalité. Il s’agira donc de vérifier graphiquement
que l’hypothèse de linéarité soit approximativement satisfaite (sachant qu’elle
ne sera jamais strictement satisfaite, ni dans un échantillon, ni même dans une
population)
5 .
La figure 13.3 nous montre quelques exemples. Dans les graphiques (a)
et (b), on dispose effectivement de 10 groupes d’individus (avec dans chaque
groupe une valeur de X différente)
6 . Dans le graphique (a), la droite de régression passe bien (approximativement) par la moyenne de la variable Y dans
5 Il y a parfois une ambiguïté de langage lorsque l’on parle de « relation linéaire » entre
deux variables. En mathématique, cela veut dire que les données individuelles sont alignées
sur une droite. En statistique, cela veut dire que des moyennes (calculées sur des individus
semblables) sont alignées sur une droite.
6 On aura cette situation dans des études expérimentales, où il sera possible de choisir (au
lieu de simplement observer) les valeurs de la variable X pour les individus de notre échantillon. On pourra par exemple choisir les doses d’un médicament administré aux patients. On
pourra ainsi former 10 groupes de patients (correspondant à 10 doses différentes), les patients
au sein d’un même groupe recevant la même dose.
197
• le poids moyen du groupe du 7
e individu (ceux mesurant 157 cm) est
estimé à 59.0 kg ; avec ses 64.0 kg, cet individu pèse donc 5.0 kg de plus
que la moyenne de son groupe.
Ainsi, bien que le 6
e individu soit plus lourd que le 7
e (poids de 68.9 kg contre
64.0 kg), il sera considéré comme moins lourd si on ajuste le poids pour la taille
(poids ajusté pour la taille de +4.8 kg contre +5.0 kg).
Une façon équivalente de définir l’hypothèse de linéarité est la suivante :
mean(ε|X = x) = mean(Y − β 0 − β 1 X|X = x)
= mean(Y |X = x) − mean(β 0 + β 1 X|X = x)
= β 0 + β 1 x − (β 0 + β 1 x)
= 0.
On a vu que l’on a de toute façon mean(ε) = 0 (que l’hypothèse de linéarité soit
satisfaite ou non). Avec l’hypothèse de linéarité, on aura en plus mean(ε|X =
x) = 0 quelle que soit la valeur de x. Ainsi, les erreurs de prédiction ne seront
pas seulement nulles en moyenne globalement, mais aussi nulles en moyenne
localement (c’est-à-dire dans chaque groupe défini par X = x). Dans notre
exemple, cela veut dire que les erreurs de prédiction seront en moyenne nulles
dans le groupe des individus mesurant 160 cm, dans le groupe des 165 cm, dans
le groupe des 170 cm, dans le groupe des 171.23 cm, etc.
Comme son nom l’indique, l’hypothèse de linéarité est une hypothèse, qui
selon les cas sera raisonnable ou non raisonnable, et qu’il s’agira de vérifier,
par exemple graphiquement. On vérifiera ainsi que la droite de régression passe
bien au milieu des points représentant les données non seulement globalement,
mais aussi localement. Comme on l’a dit pour la normalité, l’hypothèse de
linéarité est cependant un concept théorique. En pratique, l’hypothèse de linéarité ne sera jamais vraie au sens strict du terme, mais pourra constituer une
bonne approximation de la réalité. Il s’agira donc de vérifier graphiquement
que l’hypothèse de linéarité soit approximativement satisfaite (sachant qu’elle
ne sera jamais strictement satisfaite, ni dans un échantillon, ni même dans une
population)
5 .
La figure 13.3 nous montre quelques exemples. Dans les graphiques (a)
et (b), on dispose effectivement de 10 groupes d’individus (avec dans chaque
groupe une valeur de X différente)
6 . Dans le graphique (a), la droite de régression passe bien (approximativement) par la moyenne de la variable Y dans
5 Il y a parfois une ambiguïté de langage lorsque l’on parle de « relation linéaire » entre
deux variables. En mathématique, cela veut dire que les données individuelles sont alignées
sur une droite. En statistique, cela veut dire que des moyennes (calculées sur des individus
semblables) sont alignées sur une droite.
6 On aura cette situation dans des études expérimentales, où il sera possible de choisir (au
lieu de simplement observer) les valeurs de la variable X pour les individus de notre échantillon. On pourra par exemple choisir les doses d’un médicament administré aux patients. On
pourra ainsi former 10 groupes de patients (correspondant à 10 doses différentes), les patients
au sein d’un même groupe recevant la même dose.
