9. Tests de Wald et de Student
123
9.7 Test de Student pour données pairées
Dans les deux sections précédentes, on a implicitement supposé que les
données de nos deux échantillons, à partir desquels on estimait les moyennes μ 1
et μ 0 des variables Y 1 et Y 0 que l’on voulait comparer, étaient indépendantes. En
particulier, les individus mesurés dans le premier échantillon n’étaient pas les
mêmes que les individus mesurés dans le second échantillon. Cela sera forcément
le cas si les deux variables sont définies sur des populations différentes, telles
une population de femmes avec une maladie génétique et une population de
femmes sans cette maladie. Lorsque les deux variables sont définies sur la même
population, il sera parfois possible de mesurer ces deux variables sur les mêmes
individus. On aura alors deux échantillons de données mais un seul échantillon
d’individus, de sorte que les données ne seront pas indépendantes et les tests
vus dans les deux sections précédentes ne seront pas valides.
Afin d’illustrer notre propos, nous considérons un exemple où l’on aimerait
démontrer l’hypothèse scientifique qui affirme qu’un certain médicament permet d’abaisser le rythme cardiaque chez les personnes diabétiques. Les deux
variables d’intérêt sont ici les suivantes :
• Y 1 : rythme cardiaque sans le médicament
• Y 0 : rythme cardiaque avec le médicament.
Ces deux variables sont définies sur la même population (les personnes diabétiques). On a alors deux stratégies différentes pour récolter des données :
• on peut considérer deux échantillons différents de personnes diabétiques,
ne pas donner le médicament dans l’un et le donner dans l’autre, mesurer le rythme cardiaque de chaque individu, puis comparer les rythmes
cardiaques entre les deux échantillons
• on peut considérer un seul échantillon de personnes diabétiques, mesurer
le rythme cardiaque deux fois par individu, une fois sans avoir donné le
médicament et une fois après avoir l’avoir donné, puis comparer les deux
mesures.
La première stratégie correspond à ce que l’on a vu jusqu’ici. C’était le cas
dans l’exemple des Onobrychis où l’on ne pouvait pas faire autrement (on ne
pouvait pas cultiver un même Onobrychis une fois avec un niveau nutritif faible
et une fois avec un niveau nutritif élevé), de sorte que les observations étaient
considérées indépendantes. Par contre, lorsque l’on adopte la seconde stratégie,
on ne pourra pas considérer que les observations sont indépendantes car on
aura deux mesures par individu. On aura dans ce cas des données pairées et
il s’agira d’utiliser un test statistique approprié, tel le test de Student pour
données pairées (en anglais : paired t-test) que nous introduisons ci-dessous.
Nous dénotons comme d’habitude par Δ = μ 1 −μ 0 la différence des moyennes
de Y 1 et Y 0 . On aimerait donc rejeter l’hypothèse nulle suivante :
H 0 : Δ = 0
123
9.7 Test de Student pour données pairées
Dans les deux sections précédentes, on a implicitement supposé que les
données de nos deux échantillons, à partir desquels on estimait les moyennes μ 1
et μ 0 des variables Y 1 et Y 0 que l’on voulait comparer, étaient indépendantes. En
particulier, les individus mesurés dans le premier échantillon n’étaient pas les
mêmes que les individus mesurés dans le second échantillon. Cela sera forcément
le cas si les deux variables sont définies sur des populations différentes, telles
une population de femmes avec une maladie génétique et une population de
femmes sans cette maladie. Lorsque les deux variables sont définies sur la même
population, il sera parfois possible de mesurer ces deux variables sur les mêmes
individus. On aura alors deux échantillons de données mais un seul échantillon
d’individus, de sorte que les données ne seront pas indépendantes et les tests
vus dans les deux sections précédentes ne seront pas valides.
Afin d’illustrer notre propos, nous considérons un exemple où l’on aimerait
démontrer l’hypothèse scientifique qui affirme qu’un certain médicament permet d’abaisser le rythme cardiaque chez les personnes diabétiques. Les deux
variables d’intérêt sont ici les suivantes :
• Y 1 : rythme cardiaque sans le médicament
• Y 0 : rythme cardiaque avec le médicament.
Ces deux variables sont définies sur la même population (les personnes diabétiques). On a alors deux stratégies différentes pour récolter des données :
• on peut considérer deux échantillons différents de personnes diabétiques,
ne pas donner le médicament dans l’un et le donner dans l’autre, mesurer le rythme cardiaque de chaque individu, puis comparer les rythmes
cardiaques entre les deux échantillons
• on peut considérer un seul échantillon de personnes diabétiques, mesurer
le rythme cardiaque deux fois par individu, une fois sans avoir donné le
médicament et une fois après avoir l’avoir donné, puis comparer les deux
mesures.
La première stratégie correspond à ce que l’on a vu jusqu’ici. C’était le cas
dans l’exemple des Onobrychis où l’on ne pouvait pas faire autrement (on ne
pouvait pas cultiver un même Onobrychis une fois avec un niveau nutritif faible
et une fois avec un niveau nutritif élevé), de sorte que les observations étaient
considérées indépendantes. Par contre, lorsque l’on adopte la seconde stratégie,
on ne pourra pas considérer que les observations sont indépendantes car on
aura deux mesures par individu. On aura dans ce cas des données pairées et
il s’agira d’utiliser un test statistique approprié, tel le test de Student pour
données pairées (en anglais : paired t-test) que nous introduisons ci-dessous.
Nous dénotons comme d’habitude par Δ = μ 1 −μ 0 la différence des moyennes
de Y 1 et Y 0 . On aimerait donc rejeter l’hypothèse nulle suivante :
H 0 : Δ = 0
