268
Statistique appliquée aux sciences de la vie
d’intérêt
2 . On considère ci-dessous le cas simple et fréquent où l’on s’intéresse
au coefficient β 1 d’un prédicteur X 1 dans un modèle de régression linéaire avec
une variable réponse Y continue, par exemple lorsqu’il s’agit de comparer deux
groupes par rapport à cette variable Y , X 1 étant alors un prédicteur binaire (on
a vu de tels exemples dans les deux sections précédentes, respectivement pour
une étude observationnelle et pour un essai clinique). Une formule particulièrement importante à ce sujet, vue au chapitre 14 dans le cadre général d’un
modèle de régression linéaire multiple, est celle de la variance de l’estimateur
β 1 de β 1 donnée par :
Var(
β 1 ) =
σ
2
ε
n σ 2
X1
·
1
1 −
ρ 2
1
où n représente la taille totale de l’échantillon, σ
2
ε la variance résiduelle du
modèle de régression,
σ
2
X1 la variance empirique du prédicteur d’intérêt X 1
et
ρ
2
1 le pourcentage empirique de la variance de X 1 prédite linéairement par
les autres prédicteurs du modèle (on aura en particulier
ρ
2
1 = 0 s’il n’y a pas
d’autres prédicteurs dans le modèle). Il s’agit ainsi de planifier notre étude ou
notre expérience afin de minimiser cette variance, c’est-à-dire de :
• choisir n suffisamment grand
• réduire le plus possible σ
2
ε
• choisir les valeurs de notre prédicteur d’intérêt afin de minimiser
ρ
2
1
• choisir les valeurs de notre prédicteur d’intérêt afin de maximiser
σ
2
X1 .
En ce qui concerne le choix de la taille n de l’échantillon, on peut adopter
une stratégie similaire à celle évoquée au chapitre 10, à savoir choisir n de façon
à atteindre une certaine puissance statistique. Afin de rejeter l’hypothèse nulle
H 0 : β 1 = 0 dans un test de Student bilatéral au seuil α avec une probabilité
(ou puissance) de 1 − β, on choisit ainsi :
n =
(z 1−α/2 + z 1−β )
2
β 2
1
·
σ
2
ε
σ 2
X1
·
1
1 −
ρ 2
1
.
Il s’agit donc de postuler une valeur pour le véritable β 1 , mais également pour
σ
2
ε , ainsi que pour
ρ
2
1 et
σ
2
X1 (ces deux dernières quantités étant en général
contrôlées et donc connues dans le cadre d’une étude expérimentale).
Afin de réduire la variance résiduelle σ
2
ε , il s’agit d’introduire dans notre
modèle des prédicteurs importants de Y , autrement dit d’ajuster notre modèle
pour ces prédicteurs (en s’assurant toutefois que les hypothèses d’un modèle
de régression linéaire demeurent raisonnables avec l’introduction de ces prédicteurs). On a vu que cet ajustement est souvent nécessaire dans une étude
observationnelle (car ces prédicteurs sont alors souvent considérés comme des
2 On parle en anglais de design of experiment qui constitue un autre domaine spécifique
de la science statistique.
Statistique appliquée aux sciences de la vie
d’intérêt
2 . On considère ci-dessous le cas simple et fréquent où l’on s’intéresse
au coefficient β 1 d’un prédicteur X 1 dans un modèle de régression linéaire avec
une variable réponse Y continue, par exemple lorsqu’il s’agit de comparer deux
groupes par rapport à cette variable Y , X 1 étant alors un prédicteur binaire (on
a vu de tels exemples dans les deux sections précédentes, respectivement pour
une étude observationnelle et pour un essai clinique). Une formule particulièrement importante à ce sujet, vue au chapitre 14 dans le cadre général d’un
modèle de régression linéaire multiple, est celle de la variance de l’estimateur
β 1 de β 1 donnée par :
Var(
β 1 ) =
σ
2
ε
n σ 2
X1
·
1
1 −
ρ 2
1
où n représente la taille totale de l’échantillon, σ
2
ε la variance résiduelle du
modèle de régression,
σ
2
X1 la variance empirique du prédicteur d’intérêt X 1
et
ρ
2
1 le pourcentage empirique de la variance de X 1 prédite linéairement par
les autres prédicteurs du modèle (on aura en particulier
ρ
2
1 = 0 s’il n’y a pas
d’autres prédicteurs dans le modèle). Il s’agit ainsi de planifier notre étude ou
notre expérience afin de minimiser cette variance, c’est-à-dire de :
• choisir n suffisamment grand
• réduire le plus possible σ
2
ε
• choisir les valeurs de notre prédicteur d’intérêt afin de minimiser
ρ
2
1
• choisir les valeurs de notre prédicteur d’intérêt afin de maximiser
σ
2
X1 .
En ce qui concerne le choix de la taille n de l’échantillon, on peut adopter
une stratégie similaire à celle évoquée au chapitre 10, à savoir choisir n de façon
à atteindre une certaine puissance statistique. Afin de rejeter l’hypothèse nulle
H 0 : β 1 = 0 dans un test de Student bilatéral au seuil α avec une probabilité
(ou puissance) de 1 − β, on choisit ainsi :
n =
(z 1−α/2 + z 1−β )
2
β 2
1
·
σ
2
ε
σ 2
X1
·
1
1 −
ρ 2
1
.
Il s’agit donc de postuler une valeur pour le véritable β 1 , mais également pour
σ
2
ε , ainsi que pour
ρ
2
1 et
σ
2
X1 (ces deux dernières quantités étant en général
contrôlées et donc connues dans le cadre d’une étude expérimentale).
Afin de réduire la variance résiduelle σ
2
ε , il s’agit d’introduire dans notre
modèle des prédicteurs importants de Y , autrement dit d’ajuster notre modèle
pour ces prédicteurs (en s’assurant toutefois que les hypothèses d’un modèle
de régression linéaire demeurent raisonnables avec l’introduction de ces prédicteurs). On a vu que cet ajustement est souvent nécessaire dans une étude
observationnelle (car ces prédicteurs sont alors souvent considérés comme des
2 On parle en anglais de design of experiment qui constitue un autre domaine spécifique
de la science statistique.
