5. Comparaison de deux distributions
75
triques sur cette échelle) nous donne une estimation de la médiane sur l’échelle
originale. On va voir à présent que l’exponentielle d’une différence de moyenne
calculée sur l’échelle logarithmique (pour autant que les données soient à peu
près symétriques sur cette échelle) nous donne une estimation du quotient des
médianes sur l’échelle originale. On a en effet :
exp(Δ) = exp(mean(log(Y 1 )) − mean(log(Y 0 )))
≈ exp(median(log(Y 1 )) − median(log(Y 0 )))
= exp(log(median(Y 1 )) − log(median(Y 0 )))
= exp (log (median(Y 1 )/median(Y 0 )))
= median(Y 1 )/median(Y 0 ).
Exemple 5.4 On considère les données d’une étude où l’on compare le taux
de créatine entre deux groupes de femmes, un groupe de n 1 = 31 femmes atteintes d’une maladie génétique et un groupe contrôle de n 0 = 39 femmes non
atteintes de cette maladie
5 . Un des buts de cette étude est de montrer qu’un
taux anormalement élevé de créatine dans le sang pourrait être un symptôme
de cette maladie. Les boxplots du graphique du haut de la figure 5.3 comparent
les deux groupes sur l’échelle originale. On y voit non seulement des distributions manifestement asymétriques vers la droite, mais également une grande
différence de variabilité dans les deux groupes, à tel point que l’échelle utilisée
sur ce graphique n’apparaît pas du tout adaptée au groupe contrôle (que l’on
distingue à peine). On est ici loin du modèle idéal.
Les boxplots du graphique du bas de cette figure comparent les deux groupes
après une transformation logarithmique de ces données. Cette échelle logarithmique convient à présent aux deux groupes, la variance a été en grande partie
stabilisée (même si elle demeure plus grande dans le groupe maladie), la normalité a été approchée et les valeurs extrêmes ont été en grande partie réconciliées
avec les données. Il est donc ici recommandé d’effectuer l’analyse statistique
sur l’échelle logarithmique, où l’on a les résultats suivants :
•
μ 1 = 4.71, ˜
σ
2
1 = 0.83, n 1 = 31
•
μ 0 = 3.66, ˜
σ
2
0 = 0.20, n 0 = 39
•
Δ = 4.71 − 3.66 = 1.05
• ˜
σ
2 =
30·0.83+38·0.20
68
= 0.48
• on calcule un intervalle de confiance de Student au niveau 95 % pour Δ
5 Il s’agit de l’ensemble de données No 38 du livre de Andrews et Herzberg (1985). Pour
le groupe contrôle, nous avons considéré les 39 femmes de la page 224 pour lesquelles quatre
paramètres sanguins ont été mesurés. Pour le groupe maladie, nous avons considéré les 31
femmes de la page 227 pour lesquelles quatre paramètres sanguins ont été mesurés, et âgées
de moins de 50 ans.
75
triques sur cette échelle) nous donne une estimation de la médiane sur l’échelle
originale. On va voir à présent que l’exponentielle d’une différence de moyenne
calculée sur l’échelle logarithmique (pour autant que les données soient à peu
près symétriques sur cette échelle) nous donne une estimation du quotient des
médianes sur l’échelle originale. On a en effet :
exp(Δ) = exp(mean(log(Y 1 )) − mean(log(Y 0 )))
≈ exp(median(log(Y 1 )) − median(log(Y 0 )))
= exp(log(median(Y 1 )) − log(median(Y 0 )))
= exp (log (median(Y 1 )/median(Y 0 )))
= median(Y 1 )/median(Y 0 ).
Exemple 5.4 On considère les données d’une étude où l’on compare le taux
de créatine entre deux groupes de femmes, un groupe de n 1 = 31 femmes atteintes d’une maladie génétique et un groupe contrôle de n 0 = 39 femmes non
atteintes de cette maladie
5 . Un des buts de cette étude est de montrer qu’un
taux anormalement élevé de créatine dans le sang pourrait être un symptôme
de cette maladie. Les boxplots du graphique du haut de la figure 5.3 comparent
les deux groupes sur l’échelle originale. On y voit non seulement des distributions manifestement asymétriques vers la droite, mais également une grande
différence de variabilité dans les deux groupes, à tel point que l’échelle utilisée
sur ce graphique n’apparaît pas du tout adaptée au groupe contrôle (que l’on
distingue à peine). On est ici loin du modèle idéal.
Les boxplots du graphique du bas de cette figure comparent les deux groupes
après une transformation logarithmique de ces données. Cette échelle logarithmique convient à présent aux deux groupes, la variance a été en grande partie
stabilisée (même si elle demeure plus grande dans le groupe maladie), la normalité a été approchée et les valeurs extrêmes ont été en grande partie réconciliées
avec les données. Il est donc ici recommandé d’effectuer l’analyse statistique
sur l’échelle logarithmique, où l’on a les résultats suivants :
•
μ 1 = 4.71, ˜
σ
2
1 = 0.83, n 1 = 31
•
μ 0 = 3.66, ˜
σ
2
0 = 0.20, n 0 = 39
•
Δ = 4.71 − 3.66 = 1.05
• ˜
σ
2 =
30·0.83+38·0.20
68
= 0.48
• on calcule un intervalle de confiance de Student au niveau 95 % pour Δ
5 Il s’agit de l’ensemble de données No 38 du livre de Andrews et Herzberg (1985). Pour
le groupe contrôle, nous avons considéré les 39 femmes de la page 224 pour lesquelles quatre
paramètres sanguins ont été mesurés. Pour le groupe maladie, nous avons considéré les 31
femmes de la page 227 pour lesquelles quatre paramètres sanguins ont été mesurés, et âgées
de moins de 50 ans.
