232
Statistique appliquée aux sciences de la vie
Ce principe se généralise à plusieurs variables confondantes. On peut ajuster
la corrélation entre X 1 et Y pour les variables confondantes X 2 , X 3 , · · · , X m , en
introduisant toutes ces variables confondantes dans les équations de régression
calculées lors des deux premières étapes de l’algorithme ci-dessus.
Exemple 14.5 On reprend l’exemple de la motricité. Rappelons que Y dénote
le score de faux mouvements, X 1 le temps nécessaire pour accomplir un exercice
et X 2 l’âge des enfants et adolescents. On avait les corrélations suivantes :
ρ X1Y = 0.345, ρ X1X2 = −0.75 et ρ Y X2 = −0.42. On peut ainsi calculer la
corrélation partielle
ρ X1Y |X2 =
0.345 − (−0.75) · (−0.42)
(1 − (−0.75) 2 )(1 − (−0.42) 2 )
= 0.05.
Une fois éliminée l’influence de l’âge, il n’y a donc pratiquement plus de corrélation entre la rapidité et la qualité des mouvements. On retrouvera cette
même corrélation partielle de 0.05 en calculant la corrélation habituelle entre
les résidus de la régression où X 1 est la variable réponse et X 2 le prédicteur,
et les résidus de la régression où Y est la variable réponse et X 2 le prédicteur,
c’est-à-dire la corrélation entre le temps ajusté pour l’âge et le score de faux
mouvements ajusté pour l’âge, comme illustré dans la figure 14.4.
14.6 Modèle de régression linéaire multiple
Après avoir défini l’hypothèse de linéarité dans le cadre de la régression multiple, ce qui nous a permis de donner une interprétation descriptive à l’hyperplan de régression, nous allons à présent introduire les autres hypothèses de ce
qui constituera le modèle de régression linéaire multiple, qui nous permettront
de faciliter l’inférence sur l’hyperplan de régression.
Tout se passe de façon similaire à ce que l’on avait en régression simple.
L’hypothèse de linéarité concerne l’hyper-alignement des moyennes de la variable Y pour les différents groupes définis par les innombrables combinaisons
de valeurs possibles des prédicteurs. On fait ensuite une hypothèse d’homoscédasticité et une hypothèse de normalité, la première nous informant sur la
variance (qui sera constante, égale à la variance résiduelle, que l’on notera σ
2
ε ),
la seconde sur la forme (qui sera normale) de la distribution de la variable Y
dans les différents groupes. On a ainsi :
comme prédicteurs, par la formule suivante :
ρ X 1 Y |X 2 = β 1 ·
σ X 1 |X 2
σ Y |X 2
où σ X 1 |X 2 et σ Y |X 2 dénotent les écarts types des variables résiduelles définies ci-dessus. On
retrouve ainsi le lien habituel entre une corrélation et une pente de régression.
Statistique appliquée aux sciences de la vie
Ce principe se généralise à plusieurs variables confondantes. On peut ajuster
la corrélation entre X 1 et Y pour les variables confondantes X 2 , X 3 , · · · , X m , en
introduisant toutes ces variables confondantes dans les équations de régression
calculées lors des deux premières étapes de l’algorithme ci-dessus.
Exemple 14.5 On reprend l’exemple de la motricité. Rappelons que Y dénote
le score de faux mouvements, X 1 le temps nécessaire pour accomplir un exercice
et X 2 l’âge des enfants et adolescents. On avait les corrélations suivantes :
ρ X1Y = 0.345, ρ X1X2 = −0.75 et ρ Y X2 = −0.42. On peut ainsi calculer la
corrélation partielle
ρ X1Y |X2 =
0.345 − (−0.75) · (−0.42)
(1 − (−0.75) 2 )(1 − (−0.42) 2 )
= 0.05.
Une fois éliminée l’influence de l’âge, il n’y a donc pratiquement plus de corrélation entre la rapidité et la qualité des mouvements. On retrouvera cette
même corrélation partielle de 0.05 en calculant la corrélation habituelle entre
les résidus de la régression où X 1 est la variable réponse et X 2 le prédicteur,
et les résidus de la régression où Y est la variable réponse et X 2 le prédicteur,
c’est-à-dire la corrélation entre le temps ajusté pour l’âge et le score de faux
mouvements ajusté pour l’âge, comme illustré dans la figure 14.4.
14.6 Modèle de régression linéaire multiple
Après avoir défini l’hypothèse de linéarité dans le cadre de la régression multiple, ce qui nous a permis de donner une interprétation descriptive à l’hyperplan de régression, nous allons à présent introduire les autres hypothèses de ce
qui constituera le modèle de régression linéaire multiple, qui nous permettront
de faciliter l’inférence sur l’hyperplan de régression.
Tout se passe de façon similaire à ce que l’on avait en régression simple.
L’hypothèse de linéarité concerne l’hyper-alignement des moyennes de la variable Y pour les différents groupes définis par les innombrables combinaisons
de valeurs possibles des prédicteurs. On fait ensuite une hypothèse d’homoscédasticité et une hypothèse de normalité, la première nous informant sur la
variance (qui sera constante, égale à la variance résiduelle, que l’on notera σ
2
ε ),
la seconde sur la forme (qui sera normale) de la distribution de la variable Y
dans les différents groupes. On a ainsi :
comme prédicteurs, par la formule suivante :
ρ X 1 Y |X 2 = β 1 ·
σ X 1 |X 2
σ Y |X 2
où σ X 1 |X 2 et σ Y |X 2 dénotent les écarts types des variables résiduelles définies ci-dessus. On
retrouve ainsi le lien habituel entre une corrélation et une pente de régression.
