15. Régression avec prédicteurs binaires
263
Exemple 15.2 On reprend l’exemple illustré dans la figure 5.3 où l’on comparait le taux de créatine entre un groupe de n 1 = 31 femmes atteintes d’une maladie génétique et un groupe contrôle de n 0 = 39 femmes non atteintes de cette
maladie. L’objectif était de montrer qu’un taux de créatine élevé pouvait constituer un symptôme et donc être la conséquence de cette maladie. On avait logtransformé le taux de créatine afin de nous rapprocher du modèle idéal (et donc
d’un modèle de régression linéaire). On avait des taux moyens de log-créatine
de
μ 1 = 4.71 et
μ 0 = 3.66, et ainsi une différence moyenne de 1.05 en faveur du
groupe maladie qui était significative avec un test de Student (p < 0.0001). En
calculant une régression simple avec comme prédicteur binaire X 1 la maladie
(où l’on a X 1 = 1 pour le groupe malade et X 1 = 0 pour le groupe non malade)
et comme variable réponse Y le taux de log-créatine, on obtient donc :
y
∗ = 3.66 + 1.05x 1 .
Cependant, de tels résultats ne suffisent pas pour prouver que la maladie est
la cause d’un taux élevé de créatine. Comme il s’agit d’une étude observationnelle, les deux groupes de femmes diffèrent inévitablement par rapport à de
nombreuses caractéristiques. Il se trouve par exemple que le groupe malade est
nettement plus âgé que le groupe non malade (en moyenne 32.6 contre 27.3
ans). La cause du taux de créatine plus élevé dans le groupe malade pourrait
donc être l’âge plus élevé observé dans ce groupe. En introduisant l’âge X 2 dans
notre modèle de régression, on trouve cependant :
y
∗ = 2.74 + 0.87x 1 + 0.034x 2 .
Cela veut dire qu’en comparant à âge égal, on a encore une différence de
moyenne de log-créatine de 0.87 en faveur du groupe malade, qui est certes
plus petite que dans notre premier modèle, mais qui est toujours significative
(p < 0.0001). Ainsi, une partie de la différence de moyenne de 1.05 observée
entre les deux groupes peut être mise sur le compte de l’âge, mais pas toute
cette différence. Cela ne suffit toujours pas pour prouver une relation de cause
à effet entre la maladie et un taux de créatine élevé, mais on peut au moins
exclure que la différence restante de 0.87 soit due à l’âge.
La figure 15.2 illustre les résultats obtenus avec nos deux modèles. Ces diagrammes de dispersion nous montrent la relation entre l’âge et le taux de créatine (log-transformé), les individus du groupe malade étant représentés par des
triangles, ceux du groupe non malade par des cercles. Les résultats du premier
modèle sont illustrés dans le graphique du haut. On y voit deux droites horizontales (car l’association entre l’âge et le taux de créatine n’est pas prise en
compte dans ce modèle), l’une pour les malades (trait plein), l’autre pour les
non-malades (trait pointillé), qui se trouvent au niveau des moyennes calculées
dans ces deux groupes. La distance verticale entre les deux droites vaut 1.05
et représente la différence de moyenne entre les deux groupes non ajustée pour
l’âge. Les résultats du second modèle sont illustrés dans le graphique du bas.
Les deux droites ont une pente de 0.034, représentant l’association entre l’âge
263
Exemple 15.2 On reprend l’exemple illustré dans la figure 5.3 où l’on comparait le taux de créatine entre un groupe de n 1 = 31 femmes atteintes d’une maladie génétique et un groupe contrôle de n 0 = 39 femmes non atteintes de cette
maladie. L’objectif était de montrer qu’un taux de créatine élevé pouvait constituer un symptôme et donc être la conséquence de cette maladie. On avait logtransformé le taux de créatine afin de nous rapprocher du modèle idéal (et donc
d’un modèle de régression linéaire). On avait des taux moyens de log-créatine
de
μ 1 = 4.71 et
μ 0 = 3.66, et ainsi une différence moyenne de 1.05 en faveur du
groupe maladie qui était significative avec un test de Student (p < 0.0001). En
calculant une régression simple avec comme prédicteur binaire X 1 la maladie
(où l’on a X 1 = 1 pour le groupe malade et X 1 = 0 pour le groupe non malade)
et comme variable réponse Y le taux de log-créatine, on obtient donc :
y
∗ = 3.66 + 1.05x 1 .
Cependant, de tels résultats ne suffisent pas pour prouver que la maladie est
la cause d’un taux élevé de créatine. Comme il s’agit d’une étude observationnelle, les deux groupes de femmes diffèrent inévitablement par rapport à de
nombreuses caractéristiques. Il se trouve par exemple que le groupe malade est
nettement plus âgé que le groupe non malade (en moyenne 32.6 contre 27.3
ans). La cause du taux de créatine plus élevé dans le groupe malade pourrait
donc être l’âge plus élevé observé dans ce groupe. En introduisant l’âge X 2 dans
notre modèle de régression, on trouve cependant :
y
∗ = 2.74 + 0.87x 1 + 0.034x 2 .
Cela veut dire qu’en comparant à âge égal, on a encore une différence de
moyenne de log-créatine de 0.87 en faveur du groupe malade, qui est certes
plus petite que dans notre premier modèle, mais qui est toujours significative
(p < 0.0001). Ainsi, une partie de la différence de moyenne de 1.05 observée
entre les deux groupes peut être mise sur le compte de l’âge, mais pas toute
cette différence. Cela ne suffit toujours pas pour prouver une relation de cause
à effet entre la maladie et un taux de créatine élevé, mais on peut au moins
exclure que la différence restante de 0.87 soit due à l’âge.
La figure 15.2 illustre les résultats obtenus avec nos deux modèles. Ces diagrammes de dispersion nous montrent la relation entre l’âge et le taux de créatine (log-transformé), les individus du groupe malade étant représentés par des
triangles, ceux du groupe non malade par des cercles. Les résultats du premier
modèle sont illustrés dans le graphique du haut. On y voit deux droites horizontales (car l’association entre l’âge et le taux de créatine n’est pas prise en
compte dans ce modèle), l’une pour les malades (trait plein), l’autre pour les
non-malades (trait pointillé), qui se trouvent au niveau des moyennes calculées
dans ces deux groupes. La distance verticale entre les deux droites vaut 1.05
et représente la différence de moyenne entre les deux groupes non ajustée pour
l’âge. Les résultats du second modèle sont illustrés dans le graphique du bas.
Les deux droites ont une pente de 0.034, représentant l’association entre l’âge
