50
Statistique appliquée aux sciences de la vie
on remplacera souvent la valeur 1.96 par 2. La méthode qui consiste à calculer un intervalle de confiance en additionnant et soustrayant à l’estimateur un
multiple de son erreur type, fondée sur l’absence de biais et sur la normalité de
l’estimateur, est appelée méthode de Wald (du nom d’un statisticien). L’intervalle ci-dessus est appelé intervalle de confiance de Wald au niveau 95 % pour
θ.
Un intervalle de confiance au niveau 95 % pour θ contient donc la véritable
valeur du paramètre θ avec une probabilité de 95 %. Le sens de cette phrase
ne va pourtant pas de soi. En effet, l’intervalle de confiance que l’on calcule
sur notre échantillon va soit contenir soit ne pas contenir la véritable valeur
du paramètre θ. On ne sait certes pas s’il la contient ou non (vu que l’on ne
connaît pas cette véritable valeur), mais il n’y a pas d’autres possibilités. On
peut donc se demander ce que l’on veut dire par « contenir une valeur avec une
probabilité de 95 % ». De même, dans la vie courante, on peut se demander
ce que l’on veut dire lorsque l’on affirme par exemple « il y a une probabilité
de 50 % que je passe cet examen », ou « il y a une probabilité de 90 % que je
gagne ce match de tennis ».
En fait, lorsque l’on parlera de probabilité dans ce texte, il s’agira toujours
d’une proportion, c’est-à-dire d’un numérateur divisé par un dénominateur.
Afin de définir un dénominateur dans les exemples ci-dessus, on s’imaginera
une fois encore que l’on répète l’expérience. Ainsi, dire « il y a une probabilité
de 50 % que je passe cet examen » revient à dire « si je me présente 100 fois
à cet d’examen, je le passerai 50 fois », alors que dire « il y a une probabilité
de 90 % que je gagne ce match de tennis » revient à dire « si je joue 100 fois
ce match, je le gagnerai 90 fois ». De même, dire « un intervalle de confiance
contient le véritable paramètre avec une probabilité de 95 % » veut dire « si
on tire 100 échantillons de la population et si on calcule dans chacun d’entre
eux un intervalle de confiance pour ce paramètre, 95 d’entre eux contiendront
sa véritable valeur »
1 .
La figure 4.1 illustre le concept d’intervalle de confiance. La véritable valeur
du paramètre θ est représentée par la ligne verticale. Les 100 segments horizontaux représentent chacun un intervalle de confiance au niveau 95 % pour
θ, ces intervalles étant calculés dans 100 échantillons différents tirés de cette
même population. On voit que 95 d’entre eux contiennent la véritable valeur
de θ, alors que 5 d’entre eux ne la contiennent pas.
1 Nous avons commis ici une petite simplification de langage (que l’on commettra encore
quelquefois dans ce qui suit). Il faudrait dire en fait « 95 d’entre eux contiendront la véritable
valeur de ce paramètre, en moyenne ». En effet, le nombre d’intervalles de confiance sur 100
qui contiendront la véritable valeur du paramètre est lui-même une variable aléatoire. S’il
s’agit d’un intervalle de confiance exact (concept que l’on verra plus loin), la distribution de
cette variable aléatoire sera binomiale avec paramètres n = 100 et π = 0.95. Si on répétait
l’expérience (qui consiste ici à tirer 100 échantillons de la population, à calculer un intervalle
de confiance au niveau 95 % dans chacun d’entre eux, et à compter combien d’entre eux
contiennent effectivement la véritable valeur du paramètre), la réalisation de cette variable
aléatoire ne sera donc pas systématiquement 95 (mais pourra être par exemple 94, 96 ou 97).
Cependant, la moyenne de cette variable aléatoire sera égale à 95.
Précédent

- 62/327

Suivant