4
88
Biostatistiques pour le clinicien
Ce test t est valable si la distribution des variables est normale. Il
faut encore que, dans chacun des groupes que l’on compare, les
variances soient égales. Il est possible de rendre une distribution
plus normale par transformation : on remplace les valeurs par leur
racine carrée ou par leur logarithme. Sinon, il convient d’utiliser
un test non paramétrique (par exemple ici, le test de Wilcoxon ou
de Mann-Whitney).
L’analyse de variance
L’analyse de variance (ANalyis Of VAriance, appelée ANOVA) sert à
comparer les moyennes de variables quantitatives dans plus de deux
échantillons indépendants (ANOVA à un facteur). C’est également un
moyen économique d’analyser les expériences dans lesquelles deux
facteurs ou plus ont été contrôlés par l’expérimentateur (ANOVA à
deux facteurs par exemple). L’ANOVA permet de tester l’égalité des
moyennes et non des variances (comme le libellé d’analyse de variance
pourrait le laisser supposer). L’ANOVA permet, par exemple, d’interpréter la comparaison, chez des femmes qui ont une intervention
gynécologique, de la qualité de vie mesurée par des scores concernant
la santé générale, la santé mentale, l’état émotionnel etc. avant l’intervention, six semaines après et six mois après [2].
La variance commune (S
2
T
) est la variance qui serait estimée sur la
totalité de la population étudiée, tous sous-groupes que l’on cherche à
comparer, confondus. La variation interéchantillons est due aux écarts
entre les moyennes de chaque échantillon et la moyenne générale.
Le concept de variance résiduelle (S
2
R
) diffère : c’est la moyenne des
variances estimées de chaque sous-groupe. Son estimation ne nécessite
pas de prendre en compte les valeurs de chacune des mesures faites sur
la population étudiée. On peut cependant concevoir que la variance
d’un échantillon portant sur 1 000 mesures « pèse » plus lourd que
celle qui ne porterait que sur 10 mesures. L’estimation de (S² R ) est donc
obtenue en pondérant les estimations dans chaque sous-groupe par les
effectifs de ceux-ci ou plus exactement par le nombre de degrés de
liberté (n – 1). On peut encore dire que la variation interéchantillons
est liée aux facteurs que l’on souhaite comparer (des variables quantitatives), appelée pour cette raison, variation factorielle. En revanche,
la variation intra-échantillon cumule les écarts de chaque valeur individuelle de la variable à leur moyenne d’échantillon. Cette dispersion
provient des fluctuations aléatoires de l’échantillon. C’est la variation
résiduelle (S
2
R
).
88
Biostatistiques pour le clinicien
Ce test t est valable si la distribution des variables est normale. Il
faut encore que, dans chacun des groupes que l’on compare, les
variances soient égales. Il est possible de rendre une distribution
plus normale par transformation : on remplace les valeurs par leur
racine carrée ou par leur logarithme. Sinon, il convient d’utiliser
un test non paramétrique (par exemple ici, le test de Wilcoxon ou
de Mann-Whitney).
L’analyse de variance
L’analyse de variance (ANalyis Of VAriance, appelée ANOVA) sert à
comparer les moyennes de variables quantitatives dans plus de deux
échantillons indépendants (ANOVA à un facteur). C’est également un
moyen économique d’analyser les expériences dans lesquelles deux
facteurs ou plus ont été contrôlés par l’expérimentateur (ANOVA à
deux facteurs par exemple). L’ANOVA permet de tester l’égalité des
moyennes et non des variances (comme le libellé d’analyse de variance
pourrait le laisser supposer). L’ANOVA permet, par exemple, d’interpréter la comparaison, chez des femmes qui ont une intervention
gynécologique, de la qualité de vie mesurée par des scores concernant
la santé générale, la santé mentale, l’état émotionnel etc. avant l’intervention, six semaines après et six mois après [2].
La variance commune (S
2
T
) est la variance qui serait estimée sur la
totalité de la population étudiée, tous sous-groupes que l’on cherche à
comparer, confondus. La variation interéchantillons est due aux écarts
entre les moyennes de chaque échantillon et la moyenne générale.
Le concept de variance résiduelle (S
2
R
) diffère : c’est la moyenne des
variances estimées de chaque sous-groupe. Son estimation ne nécessite
pas de prendre en compte les valeurs de chacune des mesures faites sur
la population étudiée. On peut cependant concevoir que la variance
d’un échantillon portant sur 1 000 mesures « pèse » plus lourd que
celle qui ne porterait que sur 10 mesures. L’estimation de (S² R ) est donc
obtenue en pondérant les estimations dans chaque sous-groupe par les
effectifs de ceux-ci ou plus exactement par le nombre de degrés de
liberté (n – 1). On peut encore dire que la variation interéchantillons
est liée aux facteurs que l’on souhaite comparer (des variables quantitatives), appelée pour cette raison, variation factorielle. En revanche,
la variation intra-échantillon cumule les écarts de chaque valeur individuelle de la variable à leur moyenne d’échantillon. Cette dispersion
provient des fluctuations aléatoires de l’échantillon. C’est la variation
résiduelle (S
2
R
).
