94
Statistique appliquée aux sciences de la vie
deux appliqué à une table de contingence, les quatre étapes d’un test statistique
se présentent alors de la manière suivante :
• la première étape consiste à définir une statistique de test T stat comme
on vient de le faire ci-dessus
• la deuxième étape consiste à établir mathématiquement la distribution
de cette statistique de test sous l’hypothèse nulle ; il se trouve que la
distribution de T stat sous H 0 est ici (approximativement) une distribution
du khi-deux avec (I − 1)(J − 1) dl, l’approximation étant bonne si la
majorité (par exemple 80 %) des fréquences attendues sont supérieures
à 5, auquel cas le test du khi-deux est dit valide (dans notre exemple, il
s’agit donc de (4 − 1)(5 − 1) = 12 dl)
• la troisième étape consiste à calculer la réalisation t stat de la variable
aléatoire T stat dans notre échantillon (dans notre exemple t stat = 1240.0)
• la quatrième étape consiste à comparer la valeur observée (dans notre
exemple t stat = 1240.0) avec la distribution théorique de T stat sous H 0
(dans notre exemple, une distribution du khi-deux avec 12 dl), l’idée
étant de rejeter hypothèse nulle si la statistique de test observée t stat est
incompatible (trop grande) par rapport à la distribution théorique.
En ce qui concerne cette quatrième étape, on adopte la règle de rejet suivante :
On rejette H 0 au seuil α si t stat ≥ χ
2
1−α,(I−1)(J−1) .
Rappelons que l’on avait noté par χ
2
1−α,dl le quantile 1−α d’une distribution du
khi-deux avec dl degrés de liberté (on trouvera quelques-uns de ces quantiles
dans le tableau A.3 donné en annexe). En adoptant cette règle de rejet, la
probabilité de commettre une erreur de première espèce sera bel et bien de α
(elle sera du moins approximativement de α si les conditions de validité du test
sont respectées). Le graphique du haut de la figure 7.1 nous montre la région
de rejet au seuil de 5 % lorsque dl = 12. Dans notre exemple, on rejette H 0 au
seuil de 5 % car t stat = 1240.0 est beaucoup plus grand que χ
2
0.95,12 = 21.03. On
a donc réussi à prouver statistiquement notre hypothèse scientifique, à savoir
que la distribution de la couleur des cheveux n’est pas la même dans ces quatre
populations (et donc qu’il y a un lien entre couleur des cheveux et couleur des
yeux).
Le graphique du bas de la figure 7.1 illustre par ailleurs le calcul de la valeur
p qui s’obtient à partir de t stat comme suit :
p = Pr {T stat ≥ t stat } .
La valeur p est donc littéralement « la probabilité d’observer une distance T stat
entre les données et l’hypothèse nulle aussi grande (ou encore plus grande) que
Précédent

- 105/327

Suivant