204
Statistique appliquée aux sciences de la vie
L’hypothèse de linéarité concerne la moyenne de la variable Y dans les
groupes définis par les différentes valeurs possibles x de X (on suppose que
les moyennes des différents groupes sont alignées sur la droite de régression
β 0 + β 1 x). La deuxième hypothèse de notre modèle concerne la variance de la
variable Y dans ces groupes : on supposera que la variance est la même dans
chaque groupe. Si tel est le cas, cela veut dire que la qualité de la prédiction sera
identique dans chaque groupe. Cette variance commune sera alors égale à la
variance résiduelle, que l’on notera σ
2
ε . Il s’agit de l’hypothèse d’homoscédasticité
(ou de la « variance constante »). La troisième hypothèse concerne la forme
de la distribution de la variable Y dans les différents groupes : on supposera
cette distribution normale dans chaque groupe. Ces trois hypothèses spécifient
complètement la distribution de la variable Y dans les différents groupes, qui
sera donc normale de moyenne β 0 + β 1 x et de variance σ
2
ε . On a ainsi :
linéarité
: mean(Y |X = x) = β 0 + β 1 x
homoscédasticité
: variance(Y |X = x) = σ
2
ε (ne dépend pas de x)
normalité
: la variable Y |X = x est normale (quel que soit x).
Ces hypothèses peuvent se vérifier graphiquement. La figure 13.6 nous montre
quelques exemples. Dans le graphique (a), l’hypothèse de linéarité n’est pas du
tout satisfaite (la droite ne passe pas au milieu des points localement). Dans le
graphique (b), l’hypothèse de linéarité est (approximativement) satisfaite mais
l’hypothèse d’homoscédasticité ne l’est pas : la variabilité des groupes définis
par de petites valeurs x est nettement plus petite que la variabilité des groupes
définis par de grandes valeurs x (il s’agit d’un cas d’hétéroscédasticité : la variance n’est pas constante, mais augmente ici avec x). Dans le graphique (c), la
linéarité et l’homoscédasticité sont (approximativement) satisfaites, mais pas
la normalité. Dans chaque groupe, la distribution apparaît en effet très asymétrique. Les trois hypothèses sont par contre (approximativement) satisfaites
dans le graphique (d).
Lorsque l’une ou l’autre de ces hypothèses ne sera pas satisfaite, on pourra
essayer d’améliorer la situation en transformant les variables (X et/ou Y ). Notons par ailleurs que ces trois hypothèses seront satisfaites si la variable (X, Y )
est normale bivariée. Comme il n’est pas rare d’observer des distributions normales dans la nature, ce modèle linéaire sera souvent utile en pratique. En
statistique, normalité rime donc avec linéarité (et avec homoscédasticité). En
particulier, les relations entre les variables sont forcément linéaires dans un
cadre binormal
8 .
8 Attention, la réciproque n’est pas vraie. Alors que la binormalité implique un modèle de
régression linéaire, on peut avoir un modèle de régression linéaire sans avoir nécessairement
la binormalité, par exemple dans le cadre d’une étude expérimentale.
Précédent

- 213/327

Suivant