15. Régression avec prédicteurs binaires
269
variables confondantes), alors qu’un tel ajustement est également souhaitable
dans un essai clinique (dans le but de réduire σ
2
ε ). Au moment de la planification d’une étude, il faut penser aux prédicteurs à introduire dans le modèle
afin de pouvoir les mesurer sur les individus de notre échantillon.
La quantité
ρ
2
1 sera nulle (et donc minimisée) si le prédicteur d’intérêt X 1
est non corrélé avec les autres prédicteurs introduits dans le modèle. Dans
le cas où X 1 est un prédicteur binaire, X 1 sera non corrélé avec les autres
prédicteurs si ces derniers ont même moyenne dans chacun des groupes définis
par X 1 = 1 et X 1 = 0. Dans un essai clinique, cela sera approximativement le
cas grâce à la randomisation. Si on redoute que la randomisation fasse mal les
choses (surtout avec de petits échantillons), on peut lui forcer la main de façon
à ce que les deux groupes soient effectivement exactement comparables par
rapport aux prédicteurs jugés particulièrement importants. On répartira par
exemple nos individus dans les deux groupes de façon à ce que la proportion de
femmes (et donc d’hommes) y soit exactement la même, avec par exemple 60
femmes et 40 hommes dans chaque groupe, de sorte que la corrélation entre la
variable groupe et la variable sexe soit exactement nulle. Notre randomisation
sera ainsi bloquée pour le sexe (en anglais : randomized block design), ce
que l’on oppose parfois à une randomisation complète (en anglais : completely
randomized design). Si la randomisation est bloquée pour tous les prédicteurs
introduits dans notre modèle de régression, on aura effectivement
ρ
2
1 = 0.
Dans une étude observationnelle, on n’a pas de randomisation et donc pas
de randomisation bloquée, mais on pourra parfois effectuer un pairage entre les
individus des deux groupes (en anglais : matching)
3 . Dans notre exemple où
l’on comparait le taux de créatine entre un « groupe malade » et un « groupe
contrôle », ce dernier aurait pu être constitué de façon à ce que chaque femme
de ce groupe soit « pairée » avec une femme du groupe malade, de telle sorte
que les femmes des deux groupes se ressemblent par rapport à certaines caractéristiques jugées importantes (on aurait pu ainsi inclure des femmes dans le
groupe contrôle qui ont le même âge que les femmes du groupe malade). Dans
une étude observationnelle, on ne peut certes pas choisir les valeurs des prédicteurs pour les individus, mais on peut sélectionner certains individus plutôt
que d’autres dans notre échantillon afin de minimiser la quantité
ρ
2
1 .
Finalement, il s’agit de choisir les valeurs du prédicteur X 1 dans notre
échantillon (en les manipulant dans une étude expérimentale, en sélectionnant
certains individus plutôt que d’autres dans une étude observationnelle) afin de
maximiser sa variance
σ
2
X1 . En particulier, si les valeurs possibles pour X 1 sont
comprises entre 0 et 1, cette variance sera maximale si on a X 1 = 1 pour la
moitié des individus et X 1 = 0 pour l’autre moitié. Si par exemple X 1 représente
3 Notons que les techniques d’ajustement d’une part et de randomisation bloquée/pairage
d’individus d’autre part ne sont pas redondantes mais participent toutes deux de façon différente à réduire la variance de l’estimateur du paramètre d’intérêt. L’une n’exclut donc pas
l’autre et ces deux techniques peuvent être utilisées dans une même étude. En fait, un ajustement pour les prédicteurs utilisés dans un algorithme de blocage/pairage est même nécessaire
en principe, sans quoi l’hypothèse d’indépendance des résidus (la quatrième hypothèse d’un
modèle de régression linéaire) ne serait pas vérifiée.
269
variables confondantes), alors qu’un tel ajustement est également souhaitable
dans un essai clinique (dans le but de réduire σ
2
ε ). Au moment de la planification d’une étude, il faut penser aux prédicteurs à introduire dans le modèle
afin de pouvoir les mesurer sur les individus de notre échantillon.
La quantité
ρ
2
1 sera nulle (et donc minimisée) si le prédicteur d’intérêt X 1
est non corrélé avec les autres prédicteurs introduits dans le modèle. Dans
le cas où X 1 est un prédicteur binaire, X 1 sera non corrélé avec les autres
prédicteurs si ces derniers ont même moyenne dans chacun des groupes définis
par X 1 = 1 et X 1 = 0. Dans un essai clinique, cela sera approximativement le
cas grâce à la randomisation. Si on redoute que la randomisation fasse mal les
choses (surtout avec de petits échantillons), on peut lui forcer la main de façon
à ce que les deux groupes soient effectivement exactement comparables par
rapport aux prédicteurs jugés particulièrement importants. On répartira par
exemple nos individus dans les deux groupes de façon à ce que la proportion de
femmes (et donc d’hommes) y soit exactement la même, avec par exemple 60
femmes et 40 hommes dans chaque groupe, de sorte que la corrélation entre la
variable groupe et la variable sexe soit exactement nulle. Notre randomisation
sera ainsi bloquée pour le sexe (en anglais : randomized block design), ce
que l’on oppose parfois à une randomisation complète (en anglais : completely
randomized design). Si la randomisation est bloquée pour tous les prédicteurs
introduits dans notre modèle de régression, on aura effectivement
ρ
2
1 = 0.
Dans une étude observationnelle, on n’a pas de randomisation et donc pas
de randomisation bloquée, mais on pourra parfois effectuer un pairage entre les
individus des deux groupes (en anglais : matching)
3 . Dans notre exemple où
l’on comparait le taux de créatine entre un « groupe malade » et un « groupe
contrôle », ce dernier aurait pu être constitué de façon à ce que chaque femme
de ce groupe soit « pairée » avec une femme du groupe malade, de telle sorte
que les femmes des deux groupes se ressemblent par rapport à certaines caractéristiques jugées importantes (on aurait pu ainsi inclure des femmes dans le
groupe contrôle qui ont le même âge que les femmes du groupe malade). Dans
une étude observationnelle, on ne peut certes pas choisir les valeurs des prédicteurs pour les individus, mais on peut sélectionner certains individus plutôt
que d’autres dans notre échantillon afin de minimiser la quantité
ρ
2
1 .
Finalement, il s’agit de choisir les valeurs du prédicteur X 1 dans notre
échantillon (en les manipulant dans une étude expérimentale, en sélectionnant
certains individus plutôt que d’autres dans une étude observationnelle) afin de
maximiser sa variance
σ
2
X1 . En particulier, si les valeurs possibles pour X 1 sont
comprises entre 0 et 1, cette variance sera maximale si on a X 1 = 1 pour la
moitié des individus et X 1 = 0 pour l’autre moitié. Si par exemple X 1 représente
3 Notons que les techniques d’ajustement d’une part et de randomisation bloquée/pairage
d’individus d’autre part ne sont pas redondantes mais participent toutes deux de façon différente à réduire la variance de l’estimateur du paramètre d’intérêt. L’une n’exclut donc pas
l’autre et ces deux techniques peuvent être utilisées dans une même étude. En fait, un ajustement pour les prédicteurs utilisés dans un algorithme de blocage/pairage est même nécessaire
en principe, sans quoi l’hypothèse d’indépendance des résidus (la quatrième hypothèse d’un
modèle de régression linéaire) ne serait pas vérifiée.
