246
Statistique appliquée aux sciences de la vie
où
ρ
2 (H 0 ) dénote l’estimateur empirique de ρ
2 (H 0 ). La distribution de T stat
sous H 0 (et sous les hypothèses d’un modèle de régression linéaire) est une
distribution F avec paramètres dln = r et dld = n − m − 1. On rejette ainsi
l’hypothèse nulle au seuil α si on a :
t stat ≥ F 1−α,r,n−m−1 .
Il s’agit d’un test exact sous les hypothèses du modèle. Dans le cas r = m,
ce test sera identique au test F ci-dessus pour tester la nullité simultanée de
toutes les pentes du modèle (on aura alors
ρ
2 (H 0 ) = 0). Dans le cas r = 1, ce
test sera équivalent à un test de Student bilatéral pour tester la nullité de la
pente considérée.
Exemple 14.12 On reprend l’exemple de la prédiction de la graisse corporelle.
On aimerait tester si l’introduction du poids, de l’âge et de la taille dans un
modèle où l’on aurait déjà comme prédicteurs l’abdomen, le biceps et le poignet,
nous permet d’améliorer la prédiction de la graisse corporelle. L’hypothèse nulle
est ainsi :
H 0 : β 1 = β 2 = β 3 = 0.
En utilisant l’ensemble des m = 6 prédicteurs, on avait
ρ
2 = 0.726. En éliminant les r = 3 premiers d’entre eux, on obtient
ρ
2 (H 0 ) = 0.702. On calcule
alors la statistique de test suivante :
t stat =
241
3
·
0.726 − 0.702
1 − 0.726
= 7.04.
que l’on compare avec F 0.95,3,241 = 2.64. Comme t stat ≥ F 0.95,3,241 , on rejette
l’hypothèse nulle au seuil de 5 % (un logiciel statistique nous donnera p =
0.0001)
23 . On conclut que l’introduction (simultanée) du poids, de l’âge et de la
taille dans le modèle de régression permet d’améliorer significativement (bien
qu’ici modestement) le pourcentage de variance prédite et donc la qualité globale
de la prédiction de la graisse corporelle.
14.11 Multicolinéarité
Comme écrit dans un chapitre précédent, il est toujours instructif de regarder de plus près la formule de la variance d’un estimateur. En ce qui concerne
la variance de l’estimateur
β j de la pente associée au j-ième prédicteur, on a
le résultat intéressant suivant (pour j = 1, · · · , m) :
Var(
β j ) =
σ
2
ε
n σ 2
Xj
·
1
1 −
ρ 2
j
où
σ
2
Xj représente la variance empirique de X j et
ρ
2
j représente l’estimateur
empirique du pourcentage de la variance de X j prédite linéairement par les
23 Dans R, on pourra ici calculer la valeur p par la commande 1-pf(7.04,3,241).
Précédent

- 254/327

Suivant