5. Comparaison de deux distributions
77
• exp(
Δ) = exp(1.05) = 2.88
→ la différence de moyenne de 1.05 sur l’échelle logarithmique correspond
à un taux médian de créatine 2.88 fois plus élevé dans le groupe maladie
que dans le groupe contrôle
• un intervalle de confiance au niveau 95 % pour exp(Δ) s’obtient en calculant l’exponentielle des bornes d’un intervalle de confiance au niveau
95 % pour Δ :
[exp(0.72); exp(1.38)] = [2.05; 3.97]
→ notons que l’estimateur du quotient des médianes (2.88) ne se trouve
pas au centre de l’intervalle de confiance
→ on a donc prouvé statistiquement que le taux médian de créatine est
au moins 2.05 fois plus élevé dans le groupe maladie que dans le groupe
contrôle.
5.7 Différence de moyenne standardisée
On a vu que le modèle idéal (normalité et même variance dans les deux
populations) permet d’une part de donner son plein sens au paramètre de
statistique descriptive Δ et d’autre part de calculer un intervalle de confiance
exact pour Δ, y compris avec de petits échantillons. On va voir dans cette
section un troisième avantage du modèle idéal : il nous permet de standardiser
une différence de moyenne Δ par l’écart type commun σ, en calculant une
différence de moyenne standardisée comme suit :
δ = Δ/σ.
On estimera δ par
δ =
Δ/˜ σ. On exprime ainsi une différence de moyenne non
plus dans l’unité originale des variables, mais dans l’unité du statisticien : en
nombre d’écarts types.
La figure 5.4 nous montre des boxplots (fictifs) calculés dans deux groupes
satisfaisant le modèle idéal avec différentes valeurs de δ. Dans le graphique
(a), la différence de moyenne entre les deux groupes correspond à δ = 0.25
(un quart d’écart type). Sachant qu’un écart type vaut en gros le quart de
l’étendue, la différence entre les deux groupes correspond donc à un seizième
de l’étendue dans un groupe, ce qui visuellement ne semble pas grand chose.
Une telle différence est souvent considérée comme une petite différence dans
la pratique et dans la littérature
6 . Dans le graphique (b), on a une différence
6 Bien que cela dépende du contexte : une différence de gain correspondant à un δ = 0.25
obtenue en choisissant un placement en bourse plutôt qu’un autre pourrait suffire à faire de
nous des millionnaires. On pourra également parcourir à ce sujet le livre de Cohen (1988).
77
• exp(
Δ) = exp(1.05) = 2.88
→ la différence de moyenne de 1.05 sur l’échelle logarithmique correspond
à un taux médian de créatine 2.88 fois plus élevé dans le groupe maladie
que dans le groupe contrôle
• un intervalle de confiance au niveau 95 % pour exp(Δ) s’obtient en calculant l’exponentielle des bornes d’un intervalle de confiance au niveau
95 % pour Δ :
[exp(0.72); exp(1.38)] = [2.05; 3.97]
→ notons que l’estimateur du quotient des médianes (2.88) ne se trouve
pas au centre de l’intervalle de confiance
→ on a donc prouvé statistiquement que le taux médian de créatine est
au moins 2.05 fois plus élevé dans le groupe maladie que dans le groupe
contrôle.
5.7 Différence de moyenne standardisée
On a vu que le modèle idéal (normalité et même variance dans les deux
populations) permet d’une part de donner son plein sens au paramètre de
statistique descriptive Δ et d’autre part de calculer un intervalle de confiance
exact pour Δ, y compris avec de petits échantillons. On va voir dans cette
section un troisième avantage du modèle idéal : il nous permet de standardiser
une différence de moyenne Δ par l’écart type commun σ, en calculant une
différence de moyenne standardisée comme suit :
δ = Δ/σ.
On estimera δ par
δ =
Δ/˜ σ. On exprime ainsi une différence de moyenne non
plus dans l’unité originale des variables, mais dans l’unité du statisticien : en
nombre d’écarts types.
La figure 5.4 nous montre des boxplots (fictifs) calculés dans deux groupes
satisfaisant le modèle idéal avec différentes valeurs de δ. Dans le graphique
(a), la différence de moyenne entre les deux groupes correspond à δ = 0.25
(un quart d’écart type). Sachant qu’un écart type vaut en gros le quart de
l’étendue, la différence entre les deux groupes correspond donc à un seizième
de l’étendue dans un groupe, ce qui visuellement ne semble pas grand chose.
Une telle différence est souvent considérée comme une petite différence dans
la pratique et dans la littérature
6 . Dans le graphique (b), on a une différence
6 Bien que cela dépende du contexte : une différence de gain correspondant à un δ = 0.25
obtenue en choisissant un placement en bourse plutôt qu’un autre pourrait suffire à faire de
nous des millionnaires. On pourra également parcourir à ce sujet le livre de Cohen (1988).
