Chapitre 14
Régression linéaire multiple
La régression multiple est une généralisation de la régression simple. En
régression multiple, on essaiera de prédire une variable réponse Y non pas à
partir d’un seul prédicteur X, mais à partir de m prédicteurs, que l’on notera
X 1 , X 2 , · · · , X m
1 . On aura donc des données multivariées avec m + 1 variables
mesurées pour chacun des n individus de notre échantillon, que l’on notera
(x i1 , x i2 , · · · , x im , y i ), où x ij désigne l’observation du j-ième prédicteur et y i
l’observation de la variable réponse pour le i-ième individu (pour i = 1, · · · , n
et j = 1, · · · , m). On essaiera de répondre aux questions suivantes :
1. Comment peut-on prédire Y à partir de X 1 , X 2 , · · · , X m ?
→ notre but sera d’améliorer la prédiction par rapport à ce que l’on avait
en régression simple.
2. Comment se modifie Y en fonction de X 1 , X 2 , · · · , X m ?
→ ce sera ici plus compliqué qu’en régression simple.
3. Quelles sont les prédicteurs importants de Y ?
→ il s’agira d’identifier parmi les prédicteurs disponibles un sous-ensemble
de prédicteurs qui ne sont ni inutiles, ni redondants pour prédire Y
→ cette troisième question est nouvelle par rapport à ce que l’on avait en
régression simple.
1 Au lieu de prédicteurs et variable réponse, certains ouvrages utilisent les termes de variables explicatives et variable expliquée, ou encore de variables indépendantes et variable
dépendante. Nous préférons pour notre part utiliser des termes se référant à une « prédiction » plutôt qu’à une « explication » car ce dernier peut faire penser à une relation de
cause à effet entre les variables, ce qui ne sera pas forcément le cas. Le terme de variables
indépendantes pour désigner les prédicteurs peut également prêter à confusion, car ceux-ci
seront en général corrélés les uns avec les autres, et donc non indépendants au sens statistique
du terme.
219
Précédent

- 227/327

Suivant