4. Intervalle de confiance
57
• un intervalle de confiance est dit conservateur si son niveau réel
est supérieur à son niveau nominal
• un intervalle de confiance est dit libéral si son niveau réel est inférieur à son niveau nominal.
Ainsi, un intervalle de confiance de Student pour une moyenne sera exact (et a
fortiori valide) si les observations sont normales, et ceci quelle que soit la taille
n ≥ 2 de l’échantillon. Par contre, un intervalle de confiance de Wald pour une
moyenne sera libéral (et donc non valide) avec un petit n. Par exemple, si les
observations sont normales, on peut calculer que le niveau réel d’un intervalle
de confiance de Wald au niveau nominal 95 % pour une moyenne sera respectivement de 91.8 %, 87.8 % et 70.0 % avec des échantillons de taille n = 10,
n = 5 et n = 2. Toujours en supposant la normalité des observations, le niveau
réel de cet intervalle de confiance sera par contre de 93.5 % avec n = 20 et de
94.0 % avec n = 30 (la validité de l’intervalle de confiance s’améliorant avec un
grand n). En résumé, on a la situation suivante :
CI Wald
CI Student
Y i normal Y i non normal Y i normal Y i non normal
n petit non valide
non valide
exact
non valide
n grand
valide
valide
exact
valide
Comme son domaine de validité est plus large, on utilise en pratique la formule
de Student plutôt que celle de Wald lorsqu’il s’agit de calculer un intervalle de
confiance pour une moyenne. Un intervalle de confiance de Student pour une
moyenne ne sera cependant pas valide avec n petit et Y i non normale.
On peut alors revenir à la question posée dans le chapitre précédent, à savoir
« que veut dire n petit » ? La réponse, on s’en souvient, était de dire que cela
dépend du degré de non-normalité de Y i et notamment de son asymétrie. Pour
illustrer cela, nous avons effectué une série de 36 simulations, en générant à
chaque fois 10 000 échantillons de taille n = 10, 30, 50, 100, 200 ou 500, et avec
des observations Y i distribuées selon chacune des six distributions montrées
dans la figure 2.4
6 . Dans chacun de ces 10 000 échantillons, nous avons calculé
un intervalle de confiance de Student au niveau 95 % pour la moyenne μ. Nous
avons ensuite calculé la proportion d’entre eux qui contenait effectivement la
véritable valeur de μ (que nous connaissions, puisque nous avons nous-mêmes
simulé ces données). Ces proportions constituent des estimations du niveau réel
d’un intervalle de confiance de Student au niveau nominal 95 %
7 .
6 Dans R, un échantillon de taille n provenant de ces six distributions peut être généré en
utilisant respectivement les commandes suivantes : rnorm(n), rt(n,3), runif(n,-0.5,0.5),
c(rnorm(n/2,-2,1.2),rnorm(n/2,2,1)), -rchisq(n,3)+3 et rlnorm(n)-exp(0.5). Notons
que ces six distributions ont une moyenne nulle.
7 Avec 10 000 simulations, l’erreur type de l’estimateur d’une proportion est donnée par
√
0.95 · 0.05/10 000 = 0.002 (du moins si la véritable proportion vaut 0.95). Ainsi, lorsque le
niveau réel d’un intervalle de confiance est (proche de) 95 %, on l’estimera avec une précision
57
• un intervalle de confiance est dit conservateur si son niveau réel
est supérieur à son niveau nominal
• un intervalle de confiance est dit libéral si son niveau réel est inférieur à son niveau nominal.
Ainsi, un intervalle de confiance de Student pour une moyenne sera exact (et a
fortiori valide) si les observations sont normales, et ceci quelle que soit la taille
n ≥ 2 de l’échantillon. Par contre, un intervalle de confiance de Wald pour une
moyenne sera libéral (et donc non valide) avec un petit n. Par exemple, si les
observations sont normales, on peut calculer que le niveau réel d’un intervalle
de confiance de Wald au niveau nominal 95 % pour une moyenne sera respectivement de 91.8 %, 87.8 % et 70.0 % avec des échantillons de taille n = 10,
n = 5 et n = 2. Toujours en supposant la normalité des observations, le niveau
réel de cet intervalle de confiance sera par contre de 93.5 % avec n = 20 et de
94.0 % avec n = 30 (la validité de l’intervalle de confiance s’améliorant avec un
grand n). En résumé, on a la situation suivante :
CI Wald
CI Student
Y i normal Y i non normal Y i normal Y i non normal
n petit non valide
non valide
exact
non valide
n grand
valide
valide
exact
valide
Comme son domaine de validité est plus large, on utilise en pratique la formule
de Student plutôt que celle de Wald lorsqu’il s’agit de calculer un intervalle de
confiance pour une moyenne. Un intervalle de confiance de Student pour une
moyenne ne sera cependant pas valide avec n petit et Y i non normale.
On peut alors revenir à la question posée dans le chapitre précédent, à savoir
« que veut dire n petit » ? La réponse, on s’en souvient, était de dire que cela
dépend du degré de non-normalité de Y i et notamment de son asymétrie. Pour
illustrer cela, nous avons effectué une série de 36 simulations, en générant à
chaque fois 10 000 échantillons de taille n = 10, 30, 50, 100, 200 ou 500, et avec
des observations Y i distribuées selon chacune des six distributions montrées
dans la figure 2.4
6 . Dans chacun de ces 10 000 échantillons, nous avons calculé
un intervalle de confiance de Student au niveau 95 % pour la moyenne μ. Nous
avons ensuite calculé la proportion d’entre eux qui contenait effectivement la
véritable valeur de μ (que nous connaissions, puisque nous avons nous-mêmes
simulé ces données). Ces proportions constituent des estimations du niveau réel
d’un intervalle de confiance de Student au niveau nominal 95 %
7 .
6 Dans R, un échantillon de taille n provenant de ces six distributions peut être généré en
utilisant respectivement les commandes suivantes : rnorm(n), rt(n,3), runif(n,-0.5,0.5),
c(rnorm(n/2,-2,1.2),rnorm(n/2,2,1)), -rchisq(n,3)+3 et rlnorm(n)-exp(0.5). Notons
que ces six distributions ont une moyenne nulle.
7 Avec 10 000 simulations, l’erreur type de l’estimateur d’une proportion est donnée par
√
0.95 · 0.05/10 000 = 0.002 (du moins si la véritable proportion vaut 0.95). Ainsi, lorsque le
niveau réel d’un intervalle de confiance est (proche de) 95 %, on l’estimera avec une précision
