252
Statistique appliquée aux sciences de la vie
mation. Elle ne tient pas compte de l’incertitude liée au fait que les paramètres
de l’hyperplan de régression, de même que la variance résiduelle, ne sont pas
connus mais estimés. En fait, la probabilité que la valeur Y de l’individu pour
lequel on fait la prédiction se trouve à l’intérieur de cet intervalle sera un peu
plus petite que 0.95. Sous les hypothèses du modèle, il existe cependant une
formule explicite pour calculer un intervalle de prédiction exact
26 . La longueur
d’un intervalle de prédiction approximatif est de 4˜ σ ε . La longueur d’un intervalle de prédiction exact dépendra légèrement des caractéristiques de l’individu
pour lequel on fait la prédiction et sera égale « en moyenne » à :
2t 0.975,n−m−1 · ˜
σ ε ·
1 + (m + 1)/n.
L’introduction de nouveaux prédicteurs dans le modèle aura ainsi les conséquences suivantes :
• une diminution de l’écart type résiduel σ ε ainsi que (le plus souvent) de
son estimation ˜
σ ε
27
• une augmentation du facteur
1 + (m + 1)/n
• une augmentation de la valeur du quantile t 0.975,n−m−1 , négligeable cependant si n est suffisamment grand.
Dans le but d’améliorer la prédiction (c’est-à-dire ici de diminuer la longueur
des intervalles de prédiction), il s’agira d’introduire un nouveau prédicteur dans
le modèle si et seulement si la diminution de ˜
σ ε compense l’augmentation du
facteur
1 + (m + 1)/n. En particulier, l’introduction de nouveaux prédicteurs
très corrélés avec ceux déjà dans le modèle sera nuisible à la prédiction (car on
augmentera m et donc
1 + (m + 1)/n sans beaucoup diminuer ˜
σ ε ).
14.13 Choix du modèle
Dans une situation avec m prédicteurs potentiels à disposition, on pourra
choisir d’inclure ou de ne pas inclure chacun de ces prédicteurs dans notre
26 En reprenant notre notation matricielle, un intervalle de prédiction exact au niveau
1 − α pour la valeur Y d’un individu avec les caractéristiques x 1 , · · · , xm par rapport aux
prédicteurs X 1 , · · · , Xm est donné par :
x b
β ± t 1−α/2,n−m−1 · ˜
σε
q
1 + x T (X T X) −1 x
où x T = (1, x 1 , · · · , xm). Cela veut dire que si on répétait l’échantillonnage et si dans chaque
échantillon on estimait notre modèle de régression et on calculait cet intervalle de prédiction,
exactement 95 % d’entre eux contiendraient la valeur Y de cet individu.
27 En fait, l’estimateur sans biais ˜
σ 2
ε de la variance résiduelle σ 2
ε ne diminue pas forcément
lorsque l’on introduit de nouveaux prédicteurs dans le modèle, au contraire de la véritable
variance résiduelle σ 2
ε ou de son estimateur empirique b
σ 2
ε (de même, l’estimateur corrigé
˜
ρ 2 du pourcentage de variance prédite ρ 2 n’augmente pas forcément lorsque l’on introduit
de nouveaux prédicteurs dans le modèle, au contraire du véritable pourcentage de variance
prédite ρ 2 ou de son estimateur empirique b
ρ 2 ).
Précédent

- 260/327

Suivant