14. Régression linéaire multiple
255
Dans ce modèle, tous les prédicteurs ont une valeur p ≤ 0.157, de sorte que
l’on choisirait ce modèle si le but était d’optimiser la prédiction (de minimiser
la longueur des intervalles de prédiction). Par contre, certaines valeurs p sont
plus grandes que 0.05. Si notre but était d’identifier un ensemble de prédicteurs
qui sont tous significatifs, on éliminerait l’âge (p = 0.128) et on obtiendrait :
estimation erreur type
t stat valeur p
(constante)
−32.895
7.114 −4.624
0.000
poids
−0.258
0.061 −4.244
0.000
abdomen
0.963
0.057 17.038
0.000
biceps
0.277
0.153
1.818
0.070
poignet
−1.373
0.440 −3.119
0.002
À partir de là, on éliminerait encore le biceps (p = 0.070) pour obtenir :
estimation erreur type
t stat valeur p
(constante)
−29.169
6.844 −4.262
0.000
poids
−0.204
0.053 −3.827
0.000
abdomen
0.956
0.057 16.870
0.000
poignet
−1.286
0.440 −2.926
0.004
On a ici identifié un modèle avec trois prédicteurs significatifs. Si ce modèle
avait été préspécifié, on aurait ici prouvé statistiquement que chacun de ces
trois prédicteurs améliore la prédiction par rapport aux deux autres (et donc
que ces trois prédicteurs ne sont ni inutiles ni redondants)
31 .
14.14 Valeurs aberrantes et points leviers
On va s’intéresser dans cette dernière section à la distribution des résidus
empiriques
ε i . Sous les hypothèses du modèle, ils sont d’espérance nulle, normalement distribués, alors que leur variance est donnée par :
Var( ε i ) = σ
2
ε (1 − h i )
31 D’une manière générale, ces méthodes de sélection de modèle sont souvent critiquées.
Un problème est celui des tests multiples. Même si aucun des m prédicteurs potentiels n’est
utile pour prédire Y , la probabilité de sélectionner un modèle contenant au moins l’un de ces
prédicteurs sera bien plus grande que le seuil de 0.05 (si m est grand). Un autre problème
est que les méthodes d’inférence que nous avons présentées ne sont plus tout à fait valables
lorsque le modèle est sélectionné en compétition avec d’autres modèles. En effet, bien que
nos estimateurs soient sans biais, on aura tendance à choisir un modèle qui est meilleur
dans notre échantillon que dans la population (les modèles qui sont moins bons dans notre
échantillon que dans la population seront moins souvent choisis). Du coup, on aura tendance à
surestimer la performance du modèle choisi (les valeurs absolues des pentes et le pourcentage
de variance prédite seront surestimés). Pour remédier à cela, une méthode possible (mais
coûteuse en puissance statistique) consiste à diviser l’échantillon en deux parties, la première
partie étant utilisée pour la sélection du modèle, la seconde pour l’estimation et l’inférence.
Précédent

- 263/327

Suivant