88
Statistique appliquée aux sciences de la vie
6.4 Tests multiples
Malheureusement, notre compromis de 5 % qui apparaît raisonnable lorsque
l’on effectue un seul test statistique n’est souvent plus raisonnable lorsque l’on
en effectue plusieurs. Supposons que l’on considère m hypothèses nulles et que
toutes ces hypothèses nulles soient vraies (on aimerait par exemple démontrer
l’efficacité de m médicaments qui n’ont tous en réalité aucun effet). Si les données que l’on utilise pour chacun de ces tests sont indépendantes les unes des
autres, la probabilité d’obtenir au moins un (faux) résultat significatif sera de
1 − 0.95
m . Lorsque m augmente, on a ainsi une inflation du risque de première
espèce. Si on teste par exemple un médicament sans effet ni chez les hommes
ni chez les femmes, on aura une probabilité non pas de 5 % mais de 10 % de
rejeter au moins l’une des m = 2 hypothèses nulles considérées (et de conclure
à tort que le médicament a un effet, soit pour les hommes si on rejette la première hypothèse nulle, soit pour les femmes si on rejette la seconde). Le tableau
suivant nous donne d’autres exemples de cette inflation :
m 1 − 0.95
m
m
1 − 0.95
m
1
5%
6
26%
2
10%
10
40 %
3
14%
20
64 %
4
19%
50
92 %
5
23%
100
99 %
Si on teste un médicament sans effet sur m = 100 sous-groupes de patients, on
trouvera ainsi presque à coup sûr au moins un résultat significatif même si ce
médicament n’a en réalité aucun effet pour personne.
Les tests multiples constituent un sérieux problème de la statistique car
il est fréquent que plusieurs hypothèses soient testées dans une même étude.
Afin de nous prémunir contre cette inflation du risque de première espèce,
on utilise parfois une correction de Bonferroni. Cette correction consiste à ne
considérer comme significatifs que les résultats pour lesquels on a p ≤ 0.05/m.
Par exemple, un résultat avec p = 0.02 sera considéré comme significatif si on
a effectué m = 1 ou m = 2 tests, mais ne sera pas considéré comme significatif
si on a effectué m = 3 tests ou plus.
D’une manière générale, il est recommandé de limiter le nombre de tests
dans une étude. Un test statistique s’effectue en principe lors d’une analyse
confirmatoire (lorsqu’une hypothèse scientifique a été formulée a priori), non
lors d’une analyse exploratoire (lorsque l’on n’a aucune idée précise quant aux
résultats que l’on peut attendre d’une étude). Il s’agit également d’être prudent
dans nos conclusions. Si on réussit par exemple à prouver statistiquement qu’un
médicament est efficace chez les hommes mais pas chez les femmes, il serait bon
d’avoir une explication médicale crédible (et il serait encore mieux de l’avoir
formulée avant d’avoir récolté les données). Dans le cas contraire, il pourrait
s’agir d’un faux significatif.
Statistique appliquée aux sciences de la vie
6.4 Tests multiples
Malheureusement, notre compromis de 5 % qui apparaît raisonnable lorsque
l’on effectue un seul test statistique n’est souvent plus raisonnable lorsque l’on
en effectue plusieurs. Supposons que l’on considère m hypothèses nulles et que
toutes ces hypothèses nulles soient vraies (on aimerait par exemple démontrer
l’efficacité de m médicaments qui n’ont tous en réalité aucun effet). Si les données que l’on utilise pour chacun de ces tests sont indépendantes les unes des
autres, la probabilité d’obtenir au moins un (faux) résultat significatif sera de
1 − 0.95
m . Lorsque m augmente, on a ainsi une inflation du risque de première
espèce. Si on teste par exemple un médicament sans effet ni chez les hommes
ni chez les femmes, on aura une probabilité non pas de 5 % mais de 10 % de
rejeter au moins l’une des m = 2 hypothèses nulles considérées (et de conclure
à tort que le médicament a un effet, soit pour les hommes si on rejette la première hypothèse nulle, soit pour les femmes si on rejette la seconde). Le tableau
suivant nous donne d’autres exemples de cette inflation :
m 1 − 0.95
m
m
1 − 0.95
m
1
5%
6
26%
2
10%
10
40 %
3
14%
20
64 %
4
19%
50
92 %
5
23%
100
99 %
Si on teste un médicament sans effet sur m = 100 sous-groupes de patients, on
trouvera ainsi presque à coup sûr au moins un résultat significatif même si ce
médicament n’a en réalité aucun effet pour personne.
Les tests multiples constituent un sérieux problème de la statistique car
il est fréquent que plusieurs hypothèses soient testées dans une même étude.
Afin de nous prémunir contre cette inflation du risque de première espèce,
on utilise parfois une correction de Bonferroni. Cette correction consiste à ne
considérer comme significatifs que les résultats pour lesquels on a p ≤ 0.05/m.
Par exemple, un résultat avec p = 0.02 sera considéré comme significatif si on
a effectué m = 1 ou m = 2 tests, mais ne sera pas considéré comme significatif
si on a effectué m = 3 tests ou plus.
D’une manière générale, il est recommandé de limiter le nombre de tests
dans une étude. Un test statistique s’effectue en principe lors d’une analyse
confirmatoire (lorsqu’une hypothèse scientifique a été formulée a priori), non
lors d’une analyse exploratoire (lorsque l’on n’a aucune idée précise quant aux
résultats que l’on peut attendre d’une étude). Il s’agit également d’être prudent
dans nos conclusions. Si on réussit par exemple à prouver statistiquement qu’un
médicament est efficace chez les hommes mais pas chez les femmes, il serait bon
d’avoir une explication médicale crédible (et il serait encore mieux de l’avoir
formulée avant d’avoir récolté les données). Dans le cas contraire, il pourrait
s’agir d’un faux significatif.
