228
Statistique appliquée aux sciences de la vie
et X 2 l’âge. Si on considère une régression simple avec le poids comme unique
prédicteur, on obtient :
y
∗ = −13.9 + 0.406x 1 .
On estime ainsi une augmentation de 0.406 % de graisse corporelle par kg. Si
on introduit l’âge dans l’équation comme second prédicteur, on obtient :
y
∗ = −23.1 + 0.410x 1 + 0.197x 2 .
Le coefficient du poids ne s’en trouve quasiment pas modifié (on a 0.410 au
lieu de 0.406) car l’âge est quasiment non corrélé avec le poids (corrélation de
−0.02). Si l’âge et le poids avaient été exactement non corrélés, le coefficient
du poids aurait été exactement le même dans les deux équations.
14.4 Ajustement pour les variables confondantes
Dans l’avant-dernier exemple ci-dessus, la variable taille était jugée confondante pour l’association entre les variables âge et poids, étant négativement
corrélée avec la première (via un effet de génération, les générations les plus
grandes en taille étant les plus récentes et donc les moins âgées), et positivement corrélée avec la seconde. On a vu comment on peut éliminer son influence
en l’introduisant (aux côtés de l’âge) dans l’équation de régression pour prédire
le poids. L’interprétation de la pente de l’âge dans cette nouvelle équation nous
permet en effet de comparer la moyenne du poids entre deux groupes d’âges
différents mais de taille égale. On dira dans pareil cas que la relation entre
l’âge et le poids a été ajustée pour la taille. En fixant la taille, on l’empêche
de confondre. Il s’agit d’un principe fondamental de la régression multiple (et
sans doute de son utilité principale).
On introduit une variable confondante dans une équation de régression
afin de pouvoir éliminer son influence.
Ce principe se généralise au cas de plusieurs variables confondantes. Évidemment, afin de pouvoir les introduire dans l’équation, il faudra que ces variables
confondantes soient identifiées, mesurables et mesurées sur les individus de
notre échantillon, ce qui ne sera malheureusement pas toujours le cas.
Exemple 14.4 Les données ci-dessous ont été récoltées afin d’étudier le développement de la motricité chez les enfants et les adolescents
5 . La motricité est
5 Nous remercions Remo Largo et Oskar Jenni, du Département Croissance et Développement de l’Hôpital universitaire de Zurich, de nous avoir mis à disposition ces données. Elles
ont été récoltées sur des participants à l’Etude Longitudinale de Zurich et concernent un
exercice du Zurich Neuromotor Assessment (Largo et al., 2007).
Statistique appliquée aux sciences de la vie
et X 2 l’âge. Si on considère une régression simple avec le poids comme unique
prédicteur, on obtient :
y
∗ = −13.9 + 0.406x 1 .
On estime ainsi une augmentation de 0.406 % de graisse corporelle par kg. Si
on introduit l’âge dans l’équation comme second prédicteur, on obtient :
y
∗ = −23.1 + 0.410x 1 + 0.197x 2 .
Le coefficient du poids ne s’en trouve quasiment pas modifié (on a 0.410 au
lieu de 0.406) car l’âge est quasiment non corrélé avec le poids (corrélation de
−0.02). Si l’âge et le poids avaient été exactement non corrélés, le coefficient
du poids aurait été exactement le même dans les deux équations.
14.4 Ajustement pour les variables confondantes
Dans l’avant-dernier exemple ci-dessus, la variable taille était jugée confondante pour l’association entre les variables âge et poids, étant négativement
corrélée avec la première (via un effet de génération, les générations les plus
grandes en taille étant les plus récentes et donc les moins âgées), et positivement corrélée avec la seconde. On a vu comment on peut éliminer son influence
en l’introduisant (aux côtés de l’âge) dans l’équation de régression pour prédire
le poids. L’interprétation de la pente de l’âge dans cette nouvelle équation nous
permet en effet de comparer la moyenne du poids entre deux groupes d’âges
différents mais de taille égale. On dira dans pareil cas que la relation entre
l’âge et le poids a été ajustée pour la taille. En fixant la taille, on l’empêche
de confondre. Il s’agit d’un principe fondamental de la régression multiple (et
sans doute de son utilité principale).
On introduit une variable confondante dans une équation de régression
afin de pouvoir éliminer son influence.
Ce principe se généralise au cas de plusieurs variables confondantes. Évidemment, afin de pouvoir les introduire dans l’équation, il faudra que ces variables
confondantes soient identifiées, mesurables et mesurées sur les individus de
notre échantillon, ce qui ne sera malheureusement pas toujours le cas.
Exemple 14.4 Les données ci-dessous ont été récoltées afin d’étudier le développement de la motricité chez les enfants et les adolescents
5 . La motricité est
5 Nous remercions Remo Largo et Oskar Jenni, du Département Croissance et Développement de l’Hôpital universitaire de Zurich, de nous avoir mis à disposition ces données. Elles
ont été récoltées sur des participants à l’Etude Longitudinale de Zurich et concernent un
exercice du Zurich Neuromotor Assessment (Largo et al., 2007).
