5. Comparaison de deux distributions
81
5.9 Différence de proportion
Bien qu’une variable binaire soit a priori un concept plus simple qu’une
variable continue, il est en un sens plus difficile de comparer deux variables
binaires que de comparer deux variables continues. En effet, deux variables
binaires Y 1 et Y 0 avec des proportions π 1 et π 0 différentes auront également
des variances π 1 (1 − π 1 ) et π 0 (1 − π 0 ) différentes. Il s’ensuit que l’on ne peut
pas caractériser la différence entre deux distributions binaires avec un seul
paramètre (il n’existe pas de modèle idéal pour les variables binaires). Afin de
donner toute l’information, il s’agit de donner les deux paramètres π 1 et π 0 .
Le but de la statistique descriptive demeure pourtant de résumer l’information (à défaut de la caractériser) avec un seul paramètre. Lorsqu’il s’agit
de comparer deux distributions binaires, on peut considérer par exemple la
différence des proportions :
Λ = π 1 − π 0 .
Ce n’est cependant pas l’unique possibilité. Certains auteurs préfèrent le quotient des proportions π 1 /π 0 ou encore l’odds-ratio (π 1 /(1 − π 1 ))/(π 0 /(1 − π 0 ))
(concept que l’on retrouvera au chapitre 16).
À partir de deux échantillons d’observations de taille n 1 et n 0 des variables
Y 1 et Y 0 avec proportions π 1 et π 0 , on estimera Λ = π 1 − π 0 par :
Λ =
π 1 −
π 0
où
π 1 et
π 0 dénotent les proportions empiriques calculées sur ces échantillons.
On a par ailleurs les résultats suivants :
•
Λ est un estimateur sans biais et approximativement normal de Λ
• l’erreur type de cet estimateur est donnée par :
SE(
Λ) =
π 1 (1 − π 1 )
n 1
+
π 0 (1 − π 0 )
n 0
• en utilisant la méthode de Wald, on peut calculer un intervalle de confiance
au niveau 1 − α pour Λ comme suit :
Λ ± z 1−α/2 ·
π 1 (1 −
π 1 )
n 1
+
π 0 (1 −
π 0 )
n 0
.
Un intervalle de confiance de Wald pour Λ sera valide pour autant que les tailles
des échantillons n 1 et n 0 soient assez grandes et que les véritables proportions
π 1 et π 0 ne soient pas trop proches de 0 ou de 1
9 .
9 De la même manière que la validité d’un intervalle de confiance de Wald pour une proportion peut être améliorée en le calculant à partir d’un échantillon où l’on aura ajouté quatre
observations fictives, deux fois la valeur 0 et deux fois la valeur 1, Agresti et Caffo (2000)
ont suggéré d’améliorer la validité d’un intervalle de confiance de Wald pour une différence
de proportion en le calculant à partir de deux échantillons où l’on aura ajouté un 0 et un 1
dans chaque échantillon (on aura donc ici aussi ajouté en tout quatre observations fictives).
Voir également le récent article de Fagerland et al. (2011).
81
5.9 Différence de proportion
Bien qu’une variable binaire soit a priori un concept plus simple qu’une
variable continue, il est en un sens plus difficile de comparer deux variables
binaires que de comparer deux variables continues. En effet, deux variables
binaires Y 1 et Y 0 avec des proportions π 1 et π 0 différentes auront également
des variances π 1 (1 − π 1 ) et π 0 (1 − π 0 ) différentes. Il s’ensuit que l’on ne peut
pas caractériser la différence entre deux distributions binaires avec un seul
paramètre (il n’existe pas de modèle idéal pour les variables binaires). Afin de
donner toute l’information, il s’agit de donner les deux paramètres π 1 et π 0 .
Le but de la statistique descriptive demeure pourtant de résumer l’information (à défaut de la caractériser) avec un seul paramètre. Lorsqu’il s’agit
de comparer deux distributions binaires, on peut considérer par exemple la
différence des proportions :
Λ = π 1 − π 0 .
Ce n’est cependant pas l’unique possibilité. Certains auteurs préfèrent le quotient des proportions π 1 /π 0 ou encore l’odds-ratio (π 1 /(1 − π 1 ))/(π 0 /(1 − π 0 ))
(concept que l’on retrouvera au chapitre 16).
À partir de deux échantillons d’observations de taille n 1 et n 0 des variables
Y 1 et Y 0 avec proportions π 1 et π 0 , on estimera Λ = π 1 − π 0 par :
Λ =
π 1 −
π 0
où
π 1 et
π 0 dénotent les proportions empiriques calculées sur ces échantillons.
On a par ailleurs les résultats suivants :
•
Λ est un estimateur sans biais et approximativement normal de Λ
• l’erreur type de cet estimateur est donnée par :
SE(
Λ) =
π 1 (1 − π 1 )
n 1
+
π 0 (1 − π 0 )
n 0
• en utilisant la méthode de Wald, on peut calculer un intervalle de confiance
au niveau 1 − α pour Λ comme suit :
Λ ± z 1−α/2 ·
π 1 (1 −
π 1 )
n 1
+
π 0 (1 −
π 0 )
n 0
.
Un intervalle de confiance de Wald pour Λ sera valide pour autant que les tailles
des échantillons n 1 et n 0 soient assez grandes et que les véritables proportions
π 1 et π 0 ne soient pas trop proches de 0 ou de 1
9 .
9 De la même manière que la validité d’un intervalle de confiance de Wald pour une proportion peut être améliorée en le calculant à partir d’un échantillon où l’on aura ajouté quatre
observations fictives, deux fois la valeur 0 et deux fois la valeur 1, Agresti et Caffo (2000)
ont suggéré d’améliorer la validité d’un intervalle de confiance de Wald pour une différence
de proportion en le calculant à partir de deux échantillons où l’on aura ajouté un 0 et un 1
dans chaque échantillon (on aura donc ici aussi ajouté en tout quatre observations fictives).
Voir également le récent article de Fagerland et al. (2011).
