11. Tests exacts avec statistique de test discrète
147
11.3 Test exact de Fisher
Le test exact de Fisher est une alternative au test du khi-deux lorsque l’on
désire comparer deux proportions π 1 et π 0 caractérisant deux variables binaires
Y 1 et Y 0 , c’est-à-dire lorsqu’il s’agit d’essayer de rejeter l’hypothèse nulle (en
notant Λ = π 1 − π 0 ) :
H 0 : Λ = 0.
Considérons deux échantillons de n 1 et n 0 observations indépendantes de Y 1 et
Y 0 . On pourra regrouper les données dans une table de contingence :
a b
c d
où a et b représentent les fréquences d’observations avec respectivement Y 1 = 1
et Y 1 = 0, et c et d représentent les fréquences d’observations avec respectivement Y 0 = 1 et Y 0 = 0. On aura donc a + b = n 1 , c + d = n 0 , ainsi que
π 1 = a/(a+b) et
π 0 = c/(c+d), et on notera par ailleurs a+c = m 1 , b+d = m 0
et N = n 1 + n 0 = m 1 + m 0 = a + b + c + d.
La statistique de test d’un test exact de Fisher est donnée par t stat = a,
que l’on considère comme étant la réalisation d’une variable aléatoire T stat = A
définie sur la population des tables de contingence dont la somme des lignes
et la somme des colonnes sont égales à la somme des lignes et à la somme des
colonnes de la table de contingence dans notre échantillon. Autrement dit, on
s’imagine ici que l’on répète l’échantillonnage, en ne gardant cependant que les
échantillons pour lesquels on aura non seulement a + b = n 1 et c + d = n 0 ,
mais également a + c = m 1 et b + d = m 0 . Ainsi, A est une variable aléatoire
discrète avec valeurs possibles a = max(0, n 1 + m 1 − N ), · · · , min(n 1 , m 1 ).
Il se trouve que l’on connaît mathématiquement la distribution de cette
variable aléatoire sous l’hypothèse nulle. Il s’agit d’une distribution hypergéométrique avec paramètres N , n 1 et m 1 définie par les probabilités suivantes
4 :
Pr{A = a} =
m1!
a!(m1−a)! ·
(N −m1)!
(n1−a)!(N −m1−n1+a)!
N !
n1!(N −n1)!
.
Dans le cas d’un test unilatéral, le calcul de la valeur p et la décision de rejeter
ou de ne pas rejeter l’hypothèse nulle se font comme d’habitude de la manière
suivante :
• test unilatéral à gauche
→ la valeur p est définie par p = Pr{T stat ≤ t stat }, c’est-à-dire par
p = Pr{A ≤ a}
4 Il s’agit de la distribution de la fréquence de boules blanches obtenues si on tirait sans
remise n 1 boules d’une urne contenant m 1 boules blanches et N − m 1 boules noires. Dans
R, on calcule ces probabilités en utilisant la commande dhyper(a,m1,N-m1,n1).
Précédent

- 156/327

Suivant