58
Statistique appliquée aux sciences de la vie
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●● ● ●
●
●
(a) normale
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
● ●● ●
●
●
(b) Student (3 dl)
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●● ● ●
●
●
(c) uniforme
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●●●
●
●
●
(d) bimodale
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●
● ● ●
●
●
(e) khi−deux (3 dl)
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●
●
●
●
●
●
(f) log−normale
Figure 4.3 – Niveau réel d’un 95 % CI de Student pour μ selon n.
Les résultats sont montrés dans la figure 4.3. Le graphique (a) représente le
cas où les observations sont normales, cas pour lequel l’intervalle de confiance
de Student est exact, comme le confirment nos simulations. Les graphiques (b)
et (c) représentent des cas de distributions symétriques mais non normales. On
voit que le niveau réel d’un intervalle de confiance de Student reste proche du
nominal 95 %, même avec n = 10. Ce constat vaut également pour le graphique
(d) représentant le cas d’une distribution bimodale. Par contre, la situation est
moins bonne dans les deux derniers graphiques représentant des distributions
asymétriques, où le niveau réel s’approche du nominal 95 % seulement à partir
de n = 30 dans le graphique (e), et seulement à partir de n = 500 dans
le graphique (f). Des méthodes bootstrap nous permettront dans certains cas
d’améliorer la validité de nos intervalles de confiance
8 .
de ±1.96 · 0.002 = ±0.004, ce qui n’est pas si mal. Pour connaître exactement ce niveau réel,
il faudrait une erreur type nulle et donc une infinité de simulations.
8 Brièvement, les méthodes bootstrap consistent à « ré-échantillonner » (avec remise) par
exemple 500 échantillons de taille n à partir de notre échantillon initial. On obtient ainsi 500
« pseudo-échantillons » de taille n. Dans chacun de ces pseudo-échantillons, on calcule une
estimation b
θ du paramètre d’intérêt θ. On obtient ainsi 500 « pseudo-estimations ». Dans
la méthode bootstrap originale, les quantiles 2.5 % et 97.5 % de ces 500 pseudo-estimations
constituent les bornes d’un intervalle de confiance bootstrap au niveau 95 % pour θ. Cette
méthode s’applique à (presque) n’importe quel paramètre et s’avère fort utile dans les cas
Statistique appliquée aux sciences de la vie
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●● ● ●
●
●
(a) normale
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
● ●● ●
●
●
(b) Student (3 dl)
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●● ● ●
●
●
(c) uniforme
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●●●
●
●
●
(d) bimodale
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●
● ● ●
●
●
(e) khi−deux (3 dl)
0 100 200 300 400 500
0.75 0.80 0.85 0.90 0.95 1.00
n
niveau réel 95% CI
●
●
●
●
●
●
(f) log−normale
Figure 4.3 – Niveau réel d’un 95 % CI de Student pour μ selon n.
Les résultats sont montrés dans la figure 4.3. Le graphique (a) représente le
cas où les observations sont normales, cas pour lequel l’intervalle de confiance
de Student est exact, comme le confirment nos simulations. Les graphiques (b)
et (c) représentent des cas de distributions symétriques mais non normales. On
voit que le niveau réel d’un intervalle de confiance de Student reste proche du
nominal 95 %, même avec n = 10. Ce constat vaut également pour le graphique
(d) représentant le cas d’une distribution bimodale. Par contre, la situation est
moins bonne dans les deux derniers graphiques représentant des distributions
asymétriques, où le niveau réel s’approche du nominal 95 % seulement à partir
de n = 30 dans le graphique (e), et seulement à partir de n = 500 dans
le graphique (f). Des méthodes bootstrap nous permettront dans certains cas
d’améliorer la validité de nos intervalles de confiance
8 .
de ±1.96 · 0.002 = ±0.004, ce qui n’est pas si mal. Pour connaître exactement ce niveau réel,
il faudrait une erreur type nulle et donc une infinité de simulations.
8 Brièvement, les méthodes bootstrap consistent à « ré-échantillonner » (avec remise) par
exemple 500 échantillons de taille n à partir de notre échantillon initial. On obtient ainsi 500
« pseudo-échantillons » de taille n. Dans chacun de ces pseudo-échantillons, on calcule une
estimation b
θ du paramètre d’intérêt θ. On obtient ainsi 500 « pseudo-estimations ». Dans
la méthode bootstrap originale, les quantiles 2.5 % et 97.5 % de ces 500 pseudo-estimations
constituent les bornes d’un intervalle de confiance bootstrap au niveau 95 % pour θ. Cette
méthode s’applique à (presque) n’importe quel paramètre et s’avère fort utile dans les cas
