256
Statistique appliquée aux sciences de la vie
où h i est une quantité comprise entre 0 et 1
32 . Dans un exemple précédent,
nous avions calculé des résidus standardisés définis par
ε i /˜ σ ε , en mentionnant qu’ils avaient (approximativement) une distribution normale standardisée,
ce qui nous permet de détecter des valeurs extrêmes ou aberrantes. Le résultat ci-dessus nous suggère une standardisation plus fine des résidus, à savoir
ε i /(˜ σ ε
√
1 − h i ) (parfois appelés résidus studentisés).
Ainsi, la variance des résidus empiriques n’est pas la même pour tous. Elle
est d’autant plus petite que h i est grand. Une petite variance pour
ε i indique
que le i-ième résidu empirique varierait peu d’un échantillon à l’autre (si on
répétait l’échantillonnage). Une petite variance, associée à une espérance nulle,
signifie par ailleurs que ce résidu empirique sera proche de zéro. Ainsi, ce résidu
attirera l’hyperplan de régression à lui, quelle que soit la valeur y i observée.
Autrement dit, les observations avec une grande valeur h i sont des observations
qui ont une grande influence sur l’estimation de l’hyperplan de régression. On
appelle de telles observations des points leviers (en anglais : leverage points).
Un point levier est une observation loin des autres observations dans l’espace
à m dimensions défini par les prédicteurs. On a par ailleurs
i h i = m + 1,
la moyenne des h i étant égale à (m + 1)/n. En pratique, une observation est
parfois considérée comme un point levier si sa valeur h i vaut plus du double de
cette moyenne, c’est-à-dire si h i > 2(m + 1)/n.
Un point levier aura une mauvaise influence sur l’estimation de l’hyperplan
de régression s’il est par ailleurs également une valeur aberrante (c’est-à-dire
une observation qui ne devrait pas faire partie de la population décrite par
le modèle linéaire). On notera par contre qu’une observation aberrante qui
n’est pas un point levier n’aura pas une grande influence sur l’estimation des
paramètres de l’hyperplan de régression. Elle en aura cependant sur l’estimation
de la variance résiduelle et des erreurs types, qui seront surestimées, ce qui nous
coûtera de la puissance statistique.
Exemple 14.18 La figure 14.12 illustre l’influence possible d’un point levier
en régression simple (les mêmes principes étant valables en régression multiple). Dans les deux graphiques de cette figure, on a une observation aberrante
qui ne fait pas partie de la même population que les autres observations (pour
lesquelles un modèle linéaire est adéquat). Dans le graphique du haut, cette observation aberrante n’est cependant pas un point levier (se trouvant en plein
milieu des autres observations par rapport au prédicteur). Dans le graphique
du bas, l’observation aberrante est par contre un point levier (se trouvant loin
des autres, tout à droite du graphique). On a dans les deux cas calculé la droite
de régression en utilisant l’ensemble des observations (trait plein) et en excluant cette observation aberrante (trait pointillé). On voit de quelle manière
une observation aberrante qui est aussi un point levier influence dramatiquement l’estimation de la droite de régression (graphique du bas), alors qu’une
observation aberrante qui n’est pas un point levier n’a que peu d’influence sur
l’estimation de cette droite (graphique du haut).
32 On aura h i = x T
i (X T X) −1 x i où x T
i = (1, x i1 , · · · , x im ) (i = 1, · · · , n).
Statistique appliquée aux sciences de la vie
où h i est une quantité comprise entre 0 et 1
32 . Dans un exemple précédent,
nous avions calculé des résidus standardisés définis par
ε i /˜ σ ε , en mentionnant qu’ils avaient (approximativement) une distribution normale standardisée,
ce qui nous permet de détecter des valeurs extrêmes ou aberrantes. Le résultat ci-dessus nous suggère une standardisation plus fine des résidus, à savoir
ε i /(˜ σ ε
√
1 − h i ) (parfois appelés résidus studentisés).
Ainsi, la variance des résidus empiriques n’est pas la même pour tous. Elle
est d’autant plus petite que h i est grand. Une petite variance pour
ε i indique
que le i-ième résidu empirique varierait peu d’un échantillon à l’autre (si on
répétait l’échantillonnage). Une petite variance, associée à une espérance nulle,
signifie par ailleurs que ce résidu empirique sera proche de zéro. Ainsi, ce résidu
attirera l’hyperplan de régression à lui, quelle que soit la valeur y i observée.
Autrement dit, les observations avec une grande valeur h i sont des observations
qui ont une grande influence sur l’estimation de l’hyperplan de régression. On
appelle de telles observations des points leviers (en anglais : leverage points).
Un point levier est une observation loin des autres observations dans l’espace
à m dimensions défini par les prédicteurs. On a par ailleurs
i h i = m + 1,
la moyenne des h i étant égale à (m + 1)/n. En pratique, une observation est
parfois considérée comme un point levier si sa valeur h i vaut plus du double de
cette moyenne, c’est-à-dire si h i > 2(m + 1)/n.
Un point levier aura une mauvaise influence sur l’estimation de l’hyperplan
de régression s’il est par ailleurs également une valeur aberrante (c’est-à-dire
une observation qui ne devrait pas faire partie de la population décrite par
le modèle linéaire). On notera par contre qu’une observation aberrante qui
n’est pas un point levier n’aura pas une grande influence sur l’estimation des
paramètres de l’hyperplan de régression. Elle en aura cependant sur l’estimation
de la variance résiduelle et des erreurs types, qui seront surestimées, ce qui nous
coûtera de la puissance statistique.
Exemple 14.18 La figure 14.12 illustre l’influence possible d’un point levier
en régression simple (les mêmes principes étant valables en régression multiple). Dans les deux graphiques de cette figure, on a une observation aberrante
qui ne fait pas partie de la même population que les autres observations (pour
lesquelles un modèle linéaire est adéquat). Dans le graphique du haut, cette observation aberrante n’est cependant pas un point levier (se trouvant en plein
milieu des autres observations par rapport au prédicteur). Dans le graphique
du bas, l’observation aberrante est par contre un point levier (se trouvant loin
des autres, tout à droite du graphique). On a dans les deux cas calculé la droite
de régression en utilisant l’ensemble des observations (trait plein) et en excluant cette observation aberrante (trait pointillé). On voit de quelle manière
une observation aberrante qui est aussi un point levier influence dramatiquement l’estimation de la droite de régression (graphique du bas), alors qu’une
observation aberrante qui n’est pas un point levier n’a que peu d’influence sur
l’estimation de cette droite (graphique du haut).
32 On aura h i = x T
i (X T X) −1 x i où x T
i = (1, x i1 , · · · , x im ) (i = 1, · · · , n).
