196
Statistique appliquée aux sciences de la vie
13.4 Hypothèse de linéarité
On a jusqu’ici considéré la droite de régression comme un outil de prédiction.
On va à présent lui donner une interprétation descriptive plus précise en faisant
une hypothèse de linéarité. On a vu au chapitre 5 comment comparer deux
groupes par rapport à une variable continue via leur différence de moyenne.
Si on désirait analyser la relation entre la taille X et le poids Y , on pourrait
ainsi comparer un « groupe de petits » et un « groupe de grands » par rapport
à leur poids. On calculerait la moyenne des poids dans ces deux groupes et
la différence de ces moyennes. En régression, on fait mieux. On considère une
infinité de groupes : le groupe des individus mesurant 160 cm, le groupe des
165 cm, le groupe des 170 cm, le groupe des 171.23 cm, etc, et on s’intéresse
au poids moyen dans chacun de ces groupes. On notera par mean(Y |X = x)
le poids moyen du groupe mesurant x cm. L’hypothèse de linéarité consiste à
supposer que ces moyennes sont alignées sur une droite. Si elles le sont, alors
ce sera forcément sur la droite de régression.
L’hypothèse de linéarité peut ainsi être formulée de la façon suivante :
mean(Y |X = x) = β 0 + β 1 x.
Sous cette hypothèse, la quantité β 0 + β 1 x n’est pas seulement la prédiction du
poids d’un individu mesurant x cm, c’est également le poids moyen des individus mesurant x cm. Autrement dit, on prédit le poids d’un individu par le poids
moyen du groupe auquel cet individu appartient, l’erreur de prédiction étant la
différence entre le poids d’un individu et le poids moyen de son groupe. Cette
dernière sera également interprétée comme le poids d’un individu ajusté pour
sa taille. Pour les individus de notre échantillon,
y
∗
i sera donc une estimation
de mean(Y |X = x i ) et
ε i sera une estimation de y i − mean(Y |X = x i ).
Exemple 13.4 Dans notre exemple de la relation entre la taille et le poids,
on avait estimé l’équation de régression par
y
∗ = −56.23 + 0.734x. On avait
également calculé les valeurs prédites
y
∗
i et les erreurs de prédictions
ε i pour
chacun des n = 30 individus. Comparons par exemple les 6
e et 7
e individus :
• le 6
e individu mesure x 6 = 164 cm, ce qui lui vaut un poids prédit de
y
∗
6 = −56.23 + 0.734 · 164 = 64.1 kg ; or, cet individu pèse en réalité
y 6 = 68.9 kg, d’où une erreur de prédiction de
ε 6 = 68.9 − 64.1 = 4.8 kg
• le 7
e individu mesure x 7 = 157 cm, ce qui lui vaut un poids prédit de
y
∗
7 = −56.23 + 0.734 · 157 = 59.0 kg ; or, cet individu pèse en réalité
y 7 = 64.0 kg, d’où une erreur de prédiction de
ε 7 = 64.0 − 59.0 = 5.0 kg.
En faisant l’hypothèse de linéarité, on a en outre les interprétations suivantes :
• le poids moyen du groupe du 6
e individu (ceux mesurant 164 cm) est
estimé à 64.1 kg ; avec ses 68.9 kg, cet individu pèse donc 4.8 kg de plus
que la moyenne de son groupe
Statistique appliquée aux sciences de la vie
13.4 Hypothèse de linéarité
On a jusqu’ici considéré la droite de régression comme un outil de prédiction.
On va à présent lui donner une interprétation descriptive plus précise en faisant
une hypothèse de linéarité. On a vu au chapitre 5 comment comparer deux
groupes par rapport à une variable continue via leur différence de moyenne.
Si on désirait analyser la relation entre la taille X et le poids Y , on pourrait
ainsi comparer un « groupe de petits » et un « groupe de grands » par rapport
à leur poids. On calculerait la moyenne des poids dans ces deux groupes et
la différence de ces moyennes. En régression, on fait mieux. On considère une
infinité de groupes : le groupe des individus mesurant 160 cm, le groupe des
165 cm, le groupe des 170 cm, le groupe des 171.23 cm, etc, et on s’intéresse
au poids moyen dans chacun de ces groupes. On notera par mean(Y |X = x)
le poids moyen du groupe mesurant x cm. L’hypothèse de linéarité consiste à
supposer que ces moyennes sont alignées sur une droite. Si elles le sont, alors
ce sera forcément sur la droite de régression.
L’hypothèse de linéarité peut ainsi être formulée de la façon suivante :
mean(Y |X = x) = β 0 + β 1 x.
Sous cette hypothèse, la quantité β 0 + β 1 x n’est pas seulement la prédiction du
poids d’un individu mesurant x cm, c’est également le poids moyen des individus mesurant x cm. Autrement dit, on prédit le poids d’un individu par le poids
moyen du groupe auquel cet individu appartient, l’erreur de prédiction étant la
différence entre le poids d’un individu et le poids moyen de son groupe. Cette
dernière sera également interprétée comme le poids d’un individu ajusté pour
sa taille. Pour les individus de notre échantillon,
y
∗
i sera donc une estimation
de mean(Y |X = x i ) et
ε i sera une estimation de y i − mean(Y |X = x i ).
Exemple 13.4 Dans notre exemple de la relation entre la taille et le poids,
on avait estimé l’équation de régression par
y
∗ = −56.23 + 0.734x. On avait
également calculé les valeurs prédites
y
∗
i et les erreurs de prédictions
ε i pour
chacun des n = 30 individus. Comparons par exemple les 6
e et 7
e individus :
• le 6
e individu mesure x 6 = 164 cm, ce qui lui vaut un poids prédit de
y
∗
6 = −56.23 + 0.734 · 164 = 64.1 kg ; or, cet individu pèse en réalité
y 6 = 68.9 kg, d’où une erreur de prédiction de
ε 6 = 68.9 − 64.1 = 4.8 kg
• le 7
e individu mesure x 7 = 157 cm, ce qui lui vaut un poids prédit de
y
∗
7 = −56.23 + 0.734 · 157 = 59.0 kg ; or, cet individu pèse en réalité
y 7 = 64.0 kg, d’où une erreur de prédiction de
ε 7 = 64.0 − 59.0 = 5.0 kg.
En faisant l’hypothèse de linéarité, on a en outre les interprétations suivantes :
• le poids moyen du groupe du 6
e individu (ceux mesurant 164 cm) est
estimé à 64.1 kg ; avec ses 68.9 kg, cet individu pèse donc 4.8 kg de plus
que la moyenne de son groupe
