74
Statistique appliquée aux sciences de la vie
On voit que le domaine de validité de la méthode de Welch est plus large
que celui de la méthode de Student. La méthode de Welch est en effet valide
dans beaucoup de situations, à la fois avec de petits échantillons (si toutefois
la normalité des observations peut être supposée) et/ou avec des variances
différentes dans les deux populations. Cette méthode ne sera cependant pas
valide avec des distributions non normales et au moins un petit échantillon
(cas dans lequel la méthode de Student ne sera pas valide non plus).
Ainsi, la méthode de Welch devrait être la méthode de choix. Pourtant, en
pratique et dans la littérature, on a souvent tendance à croire au modèle idéal
(que l’on atteindra parfois par transformation des données) et à calculer un
intervalle de confiance de Student, qui sera alors exact et qui aura par ailleurs
l’avantage d’être plus facilement généralisable à des problèmes de modélisation
statistique plus complexes, tels ceux que nous verrons lorsque nous traiterons
de régression (à partir du chapitre 13). Lorsque les variances des deux populations sont différentes et que les échantillons ont des tailles différentes, il est
toutefois important de savoir qu’un intervalle de confiance de Student ne sera
pas valide (même avec de grands échantillons et des observations normales)
4 .
Nous reviendrons sur la question du choix entre les méthodes de Welch et de
Student au chapitre 11.
5.6 Transformation logarithmique
Lorsque les hypothèses du modèle idéal ne sont pas satisfaites, on peut
essayer de s’en rapprocher en appliquant une tranformation logarithmique. Il
n’est en effet pas rare qu’une telle transformation nous permette de stabiliser
la variance (la rendre comparable dans les deux groupes) en même temps que
de nous rapprocher de la normalité.
On a vu au chapitre 2 que l’exponentielle d’une moyenne calculée sur
l’échelle logarithmique (pour autant que les données soient à peu près symé4 Si les variances et les tailles d’échantillon sont différentes, un intervalle de confiance de
Student sera libéral si c’est le petit échantillon qui provient de la population avec la plus
grande variabilité, et il sera conservateur dans le cas contraire. Pour être plus précis, si on
veut que le niveau réel d’un intervalle de confiance de Student au niveau nominal 1 − α pour
Δ soit au plus de 1 − α − et au moins de 1 − α + (où α − < α < α + ), il faudra que la condition
suivante soit satisfaite (on suppose ici que n 1 et n 0 sont assez grands) :
z 1−α/2
z 1−α − /2
≤
s
1 + (n 1 /n 0 )(σ 2
0 /σ 2
1 )
n 1 /n 0 + σ 2
0 /σ 2
1
≤
z 1−α/2
z 1−α + /2
.
Dans le cas où l’on choisit α = 0.05, α − = 0.035 et α + = 0.065, ce qui implique z 1−α/2 =
1.96, z 1−α − /2 = 2.11 et z 1−α + /2 = 1.845, cette condition sera satisfaite si :
0.93 ≤
s
1 + (n 1 /n 0 )(σ 2
0 /σ 2
1 )
n 1 /n 0 + σ 2
0 /σ 2
1
≤ 1.06
par exemple si (1/1.2) ≤ n 1 /n 0 ≤ 1.2 et si 0.5 ≤ σ 0 /σ 1 ≤ 2, c’est-à-dire si la taille du grand
échantillon n’excède pas de plus de 20 % la taille du petit, et si le plus grand des écarts types
ne vaut pas plus du double du plus petit (dans les populations).
Statistique appliquée aux sciences de la vie
On voit que le domaine de validité de la méthode de Welch est plus large
que celui de la méthode de Student. La méthode de Welch est en effet valide
dans beaucoup de situations, à la fois avec de petits échantillons (si toutefois
la normalité des observations peut être supposée) et/ou avec des variances
différentes dans les deux populations. Cette méthode ne sera cependant pas
valide avec des distributions non normales et au moins un petit échantillon
(cas dans lequel la méthode de Student ne sera pas valide non plus).
Ainsi, la méthode de Welch devrait être la méthode de choix. Pourtant, en
pratique et dans la littérature, on a souvent tendance à croire au modèle idéal
(que l’on atteindra parfois par transformation des données) et à calculer un
intervalle de confiance de Student, qui sera alors exact et qui aura par ailleurs
l’avantage d’être plus facilement généralisable à des problèmes de modélisation
statistique plus complexes, tels ceux que nous verrons lorsque nous traiterons
de régression (à partir du chapitre 13). Lorsque les variances des deux populations sont différentes et que les échantillons ont des tailles différentes, il est
toutefois important de savoir qu’un intervalle de confiance de Student ne sera
pas valide (même avec de grands échantillons et des observations normales)
4 .
Nous reviendrons sur la question du choix entre les méthodes de Welch et de
Student au chapitre 11.
5.6 Transformation logarithmique
Lorsque les hypothèses du modèle idéal ne sont pas satisfaites, on peut
essayer de s’en rapprocher en appliquant une tranformation logarithmique. Il
n’est en effet pas rare qu’une telle transformation nous permette de stabiliser
la variance (la rendre comparable dans les deux groupes) en même temps que
de nous rapprocher de la normalité.
On a vu au chapitre 2 que l’exponentielle d’une moyenne calculée sur
l’échelle logarithmique (pour autant que les données soient à peu près symé4 Si les variances et les tailles d’échantillon sont différentes, un intervalle de confiance de
Student sera libéral si c’est le petit échantillon qui provient de la population avec la plus
grande variabilité, et il sera conservateur dans le cas contraire. Pour être plus précis, si on
veut que le niveau réel d’un intervalle de confiance de Student au niveau nominal 1 − α pour
Δ soit au plus de 1 − α − et au moins de 1 − α + (où α − < α < α + ), il faudra que la condition
suivante soit satisfaite (on suppose ici que n 1 et n 0 sont assez grands) :
z 1−α/2
z 1−α − /2
≤
s
1 + (n 1 /n 0 )(σ 2
0 /σ 2
1 )
n 1 /n 0 + σ 2
0 /σ 2
1
≤
z 1−α/2
z 1−α + /2
.
Dans le cas où l’on choisit α = 0.05, α − = 0.035 et α + = 0.065, ce qui implique z 1−α/2 =
1.96, z 1−α − /2 = 2.11 et z 1−α + /2 = 1.845, cette condition sera satisfaite si :
0.93 ≤
s
1 + (n 1 /n 0 )(σ 2
0 /σ 2
1 )
n 1 /n 0 + σ 2
0 /σ 2
1
≤ 1.06
par exemple si (1/1.2) ≤ n 1 /n 0 ≤ 1.2 et si 0.5 ≤ σ 0 /σ 1 ≤ 2, c’est-à-dire si la taille du grand
échantillon n’excède pas de plus de 20 % la taille du petit, et si le plus grand des écarts types
ne vaut pas plus du double du plus petit (dans les populations).
