15. Régression avec prédicteurs binaires
265
par rapport à leur état de santé, mais aussi par rapport à toutes les variables
confondantes potentielles (qu’elles soient connues ou inconnues, mesurables ou
non mesurables). La seule différence entre les deux groupes au début de l’étude
est contrôlée : il s’agit du médicament que les individus du premier groupe
reçoivent et que les individus du second groupe ne reçoivent pas. Dans ces
conditions, une différence entre l’état de santé des patients des deux groupes à
la fin de l’étude pourra légitimement être interprétée comme un effet causal du
médicament
1 .
D’un point de vue statistique, l’analyse des données d’un essai clinique
consistera simplement en une comparaison de deux groupes par rapport à une
variable d’intérêt, par exemple une variable continue. Si X représente le groupe
(avec dans notre exemple X = 1 pour le médicament et X = 0 pour le placebo)
et Y la variable d’intérêt (par exemple l’état de santé d’un patient après six
mois de traitement), on pourra effectuer un test de Student sur la différence
de moyenne de Y entre les deux groupes, ou de façon équivalente un test de
Student sur la pente de la droite de régression dans un modèle avec X comme
prédicteur et Y comme variable réponse, cette pente étant donc ici interprétée
comme l’effet causal de X sur Y . Ici aussi, on pourra introduire (en plus du
groupe) d’autres prédicteurs dans ce modèle de régression. Cela nous permettra d’une part de corriger certains défauts éventuels de la randomisation par
rapport à ces prédicteurs (au cas où le hasard aurait mal fait les choses, par
exemple au cas où un groupe serait nettement plus âgé que l’autre malgré la
randomisation). D’autre part, cela nous permettra de diminuer l’écart type résiduel de la régression et donc l’erreur type de l’estimateur de notre effet causal
(on reviendra sur ce point dans la section suivante).
Exemple 15.3 Nous présentons les résultats d’un essai clinique où l’on compare deux groupes de n 1 = n 0 = 40 patients en surpoids, volontaires pour faire
un régime de trois mois. On note par X 1 la variable définissant les groupes.
Dans le groupe X 1 = 1, les patients ont bénéficié d’un médicament pour accompagner le régime et les aider à perdre du poids. Dans le groupe X 1 = 0,
les patients ont reçu à la place un placebo. La variable réponse Y est la perte
de poids après trois mois. En moyenne, les patients du groupe médicament ont
perdu
μ 1 = 4.72 kg, alors que les patients du groupe placebo ont perdu
μ 0 = 2.47
kg. La différence de moyenne, qui peut être ici interprétée comme l’effet causal
du médicament, est ainsi estimée à 4.72 − 2.47 = 2.25 kg. L’erreur type de cet
estimateur est de 0.70 kg. La statistique de test d’un test de Student pour comparer ces deux moyennes est donnée par t stat = 2.25/0.70 = 3.21, l’effet causal
du médicament étant donc significatif (p = 0.002). Un intervalle de confiance
au niveau 95 % pour le véritable effet causal du médicament est par ailleurs
1 Il ne sera malheureusement pas toujours possible d’effectuer un essai clinique, que ce
soit pour des raisons pratiques, techniques ou éthiques. Pour la question du tabac évoquée
dans la section précédente, on ne pourra pas forcer les individus d’un groupe à fumer et les
individus de l’autre groupe à ne pas fumer.
265
par rapport à leur état de santé, mais aussi par rapport à toutes les variables
confondantes potentielles (qu’elles soient connues ou inconnues, mesurables ou
non mesurables). La seule différence entre les deux groupes au début de l’étude
est contrôlée : il s’agit du médicament que les individus du premier groupe
reçoivent et que les individus du second groupe ne reçoivent pas. Dans ces
conditions, une différence entre l’état de santé des patients des deux groupes à
la fin de l’étude pourra légitimement être interprétée comme un effet causal du
médicament
1 .
D’un point de vue statistique, l’analyse des données d’un essai clinique
consistera simplement en une comparaison de deux groupes par rapport à une
variable d’intérêt, par exemple une variable continue. Si X représente le groupe
(avec dans notre exemple X = 1 pour le médicament et X = 0 pour le placebo)
et Y la variable d’intérêt (par exemple l’état de santé d’un patient après six
mois de traitement), on pourra effectuer un test de Student sur la différence
de moyenne de Y entre les deux groupes, ou de façon équivalente un test de
Student sur la pente de la droite de régression dans un modèle avec X comme
prédicteur et Y comme variable réponse, cette pente étant donc ici interprétée
comme l’effet causal de X sur Y . Ici aussi, on pourra introduire (en plus du
groupe) d’autres prédicteurs dans ce modèle de régression. Cela nous permettra d’une part de corriger certains défauts éventuels de la randomisation par
rapport à ces prédicteurs (au cas où le hasard aurait mal fait les choses, par
exemple au cas où un groupe serait nettement plus âgé que l’autre malgré la
randomisation). D’autre part, cela nous permettra de diminuer l’écart type résiduel de la régression et donc l’erreur type de l’estimateur de notre effet causal
(on reviendra sur ce point dans la section suivante).
Exemple 15.3 Nous présentons les résultats d’un essai clinique où l’on compare deux groupes de n 1 = n 0 = 40 patients en surpoids, volontaires pour faire
un régime de trois mois. On note par X 1 la variable définissant les groupes.
Dans le groupe X 1 = 1, les patients ont bénéficié d’un médicament pour accompagner le régime et les aider à perdre du poids. Dans le groupe X 1 = 0,
les patients ont reçu à la place un placebo. La variable réponse Y est la perte
de poids après trois mois. En moyenne, les patients du groupe médicament ont
perdu
μ 1 = 4.72 kg, alors que les patients du groupe placebo ont perdu
μ 0 = 2.47
kg. La différence de moyenne, qui peut être ici interprétée comme l’effet causal
du médicament, est ainsi estimée à 4.72 − 2.47 = 2.25 kg. L’erreur type de cet
estimateur est de 0.70 kg. La statistique de test d’un test de Student pour comparer ces deux moyennes est donnée par t stat = 2.25/0.70 = 3.21, l’effet causal
du médicament étant donc significatif (p = 0.002). Un intervalle de confiance
au niveau 95 % pour le véritable effet causal du médicament est par ailleurs
1 Il ne sera malheureusement pas toujours possible d’effectuer un essai clinique, que ce
soit pour des raisons pratiques, techniques ou éthiques. Pour la question du tabac évoquée
dans la section précédente, on ne pourra pas forcer les individus d’un groupe à fumer et les
individus de l’autre groupe à ne pas fumer.
