6. Principe d’un test statistique
89
6.5 Statistique de test
Afin d’essayer de rejeter une hypothèse nulle, on utilise les données de notre
échantillon. Les données d’un échantillon constituent donc une preuve (qui sera
convaincante ou non) contre une hypothèse nulle. Plus concrètement, il s’agit
de calculer une distance entre les données de l’échantillon et l’hypothèse nulle,
que l’on appellera une statistique de test et que l’on notera par T stat .
Comme tout ce qui est calculé sur un échantillon, une statistique de test peut
se voir comme une variable aléatoire : on l’observe en pratique une seule fois,
sur notre seul échantillon, mais en théorie (et avec un peu d’imagination) on
pourrait l’observer plusieurs fois si on répétait l’expérience. On peut donc parler
de la distribution d’une statistique de test. Plus précisément, on s’intéressera
à la distribution de la statistique de test sous l’hypothèse nulle. On s’imagine
ainsi que l’on répète l’expérience, non pas sous les conditions réelles d’une
étude, mais sous les conditions spécifiées par l’hypothèse nulle. Il s’agit d’établir
mathématiquement quelle est cette distribution, afin de savoir ce que l’on est
en droit d’attendre de cette statistique de test sous l’hypothèse nulle.
On notera par t stat la réalisation de T stat (la valeur de T stat calculée/observée
sur notre échantillon). Il s’agit de la distance observée entre les données de notre
échantillon et l’hypothèse nulle. On comparera ensuite t stat avec la distribution
théorique de T stat établie sous l’hypothèse nulle. Si l’observation (t stat ) n’est
pas compatible avec la théorie (distribution de T stat sous H 0 ), on dira que les
données ne sont pas compatibles avec l’hypothèse nulle, qui sera ainsi rejetée.
Un test statistique s’effectue donc en quatre étapes de la manière suivante :
• définir une statistique de test T stat calculable sur un échantillon
• établir mathématiquement la distribution théorique de T stat sous H 0
• calculer la réalisation t stat de T stat sur notre échantillon
• comparer t stat avec la distribution théorique de T stat sous H 0 .
Les deux premières étapes sont des étapes théoriques, fondées sur les mathématiques. Les données entrent en jeu à partir de la troisième étape. La quatrième
étape est le calcul de la valeur p, qui mesure à quel point les données sont
incompatibles avec l’hypothèse nulle, et qui nous permet de décider si on rejette ou non l’hypothèse nulle. Nous verrons de nombreux exemples dans les
chapitres suivants. Notons encore qu’un test statistique sera dit exact si on
connaît mathématiquement (et si on utilise effectivement) la distribution de la
statistique de test sous H 0 , alors qu’il sera dit valide si à défaut de la connaître
exactement, on dispose d’une bonne approximation de cette distribution
4 .
4 Comme tout ce qui se calcule à partir d’un échantillon, la valeur p, qui sera une fonction
de la statistique de test tstat, peut être vue comme la réalisation d’une variable aléatoire
P (fonction de Tstat). Si Tstat est continue, un test statistique sera exact si la distribution
de P sous H 0 est uniforme entre 0 et 1, c’est-à-dire si Pr {P ≤ α} = α (la probabilité de
commettre une erreur de première espèce étant ainsi bel et bien exactement égale à α).
Précédent

- 101/327

Suivant