14. Régression linéaire multiple
253
modèle, ce qui définit 2
m modèles linéaires différents. Admettons que chacun
d’entre eux satisfasse (approximativement) les hypothèses d’un modèle de régression linéaire, lequel doit-on choisir en pratique ? La réponse à cette question
dépend de notre motivation à effectuer une régression multiple. Voici trois motivations possibles, en lien avec les trois questions énoncées en début de chapitre :
1. On aimerait prédire au mieux Y (c’est-à-dire minimiser la longueur
des intervalles de prédiction) en fonction des prédicteurs à disposition.
2. On aimerait estimer une association entre Y et un prédicteur X 1
ajustée pour les autres prédicteurs (considérés comme des variables
confondantes).
3. On aimerait identifier un modèle avec uniquement des prédicteurs
dont on a prouvé statistiquement qu’ils ne sont ni inutiles, ni
redondants pour prédire Y (afin d’obtenir une description parcimonieuse de nos données).
On choisira alors le modèle de la façon suivante :
• dans le premier cas, une stratégie possible consiste à choisir le modèle
qui minimise la quantité ˜
σ ε ·
1 + (m + 1)/n discutée en fin de section
précédente
28
→ les valeurs p associées aux pentes des prédicteurs dans un tel modèle
seront toutes plus petites que 0.157, du moins pour un grand n
29
→ afin d’optimiser la prédiction, on pourra donc avoir dans notre modèle
des prédicteurs qui ne sont pas significatifs au seuil de 5 % (mais qui sont
significatifs au seuil de 15.7 %)
• dans le deuxième cas, c’est à nous de décider (en principe sans avoir
regardé les données au préalable) quels sont les prédicteurs (quelles sont
les variables confondantes) à introduire dans le modèle
→ on gardera dans notre modèle les prédicteurs jugés confondants indépendamment des valeurs p
28 Minimiser cette quantité est équivalent (pour de grands n) à minimiser le critère dit AIC
(Akaike Information Criterion) introduit par Hirotsugu Akaike en 1973. On pourra lire à
ce sujet le livre de Burnham et Anderson (2004) ou l’article de Rousson et Goşoniu (2007).
29 Pour se convaincre de cela, on montrera tout d’abord à l’aide d’algèbre élémentaire
que l’introduction d’un prédicteur supplémentaire dans le modèle diminue notre critère ˜
σε ·
p
1 + (m + 1)/n si et seulement si tstat ≥ 2n/(n + m), où tstat dénote la statistique de
test d’un test du F partiel sur la nullité de la pente du nouveau prédicteur. Pour un grand
n, on diminuera donc notre critère si tstat ≥ 2. Rappelons que l’on compare tstat à une
distribution F avec paramètres dln = 1 et dld = n − m − 1. Or, pour un grand n, cette
distribution sera proche d’une distribution du khi-deux avec 1 dl. Par ailleurs, la valeur 2
correspond au quantile 84.3 % d’une telle distribution. Dire que tstat ≥ 2 revient donc à dire
que p ≤ 0.157.
Précédent

- 261/327

Suivant