254
Statistique appliquée aux sciences de la vie
• dans le troisième cas, on choisit généralement un modèle où chaque prédicteur est significatif au seuil de 5 %.
Exemple 14.16 On reprend l’exemple des individus qui ont suivi un régime,
avec comme variable réponse Y la perte de poids, et comme prédicteurs potentiels X 1 la perte de glucose et X 2 la perte de cholestérol. Si notre but est de
prédire au mieux la perte de poids des individus, on choisira le modèle avec
la perte de cholestérol comme seul prédicteur (car on obtient p = 0.36 pour
la perte de glucose lorsqu’on l’introduit dans ce modèle, ce qui est largement
au-dessus de 0.157). Par contre, si notre but est d’étudier l’association entre
la perte de cholestérol et la perte de poids, et que l’on juge la perte de glucose
comme étant une variable confondante pour cette association, alors on n’aura
pas d’autre choix que le modèle incluant les deux prédicteurs.
Si notre motivation est d’optimiser la prédiction, une stratégie possible
consiste à calculer les 2
m modèles envisageables et à choisir celui pour lequel
notre critère ˜
σ ε ·
1 + (m + 1)/n est minimisé. Afin d’économiser du temps de
calcul, on ne considère parfois qu’un sous-ensemble de ces 2
m modèles. Une méthode souvent utilisée consiste à calculer tout d’abord le modèle avec l’ensemble
des m prédicteurs, puis à éliminer le prédicteur associé à la plus grande valeur
p et à continuer ainsi jusqu’à ce que toutes les valeurs p soient plus petites
que 0.157. En anglais, il s’agit de la méthode backward elimination
30 . En
utilisant cette méthode, on n’est pas sûr d’identifier le meilleur modèle, mais
on trouvera souvent « un bon modèle ». On pourra utiliser la même méthode
en utilisant un seuil de 0.05 au lieu de 0.157 si notre motivation est l’identification d’un ensemble de prédicteurs importants (ni inutiles, ni redondants). Par
contre, une telle méthode ne doit pas être utilisée si notre motivation est l’estimation d’une association ajustée pour les variables confondantes (où le choix
des prédicteurs à inclure dans le modèle dépend de la question scientifique posée
et non du résultat de tests statistiques).
Exemple 14.17 Appliquons la méthode « backward elimination » décrite cidessus à notre exemple de la prédiction de la graisse corporelle. Dans le modèle
avec les m = 6 prédicteurs, le prédicteur associé à la plus grande valeur p était
la taille (p = 0.240). Si on élimine la taille, on obtient le modèle suivant :
estimation erreur type
t stat valeur p
(constante)
−28.080
7.764 −3.617
0.000
poids
−0.196
0.073 −2.671
0.008
âge
0.044
0.029
1.527
0.128
abdomen
0.899
0.070 12.755
0.000
biceps
0.292
0.152
1.913
0.057
poignet
−1.721
0.495 −3.479
0.001
30 Il existe de nombreuses variantes de cette méthode, par exemple, la méthode dite en
anglais forward selection.
Statistique appliquée aux sciences de la vie
• dans le troisième cas, on choisit généralement un modèle où chaque prédicteur est significatif au seuil de 5 %.
Exemple 14.16 On reprend l’exemple des individus qui ont suivi un régime,
avec comme variable réponse Y la perte de poids, et comme prédicteurs potentiels X 1 la perte de glucose et X 2 la perte de cholestérol. Si notre but est de
prédire au mieux la perte de poids des individus, on choisira le modèle avec
la perte de cholestérol comme seul prédicteur (car on obtient p = 0.36 pour
la perte de glucose lorsqu’on l’introduit dans ce modèle, ce qui est largement
au-dessus de 0.157). Par contre, si notre but est d’étudier l’association entre
la perte de cholestérol et la perte de poids, et que l’on juge la perte de glucose
comme étant une variable confondante pour cette association, alors on n’aura
pas d’autre choix que le modèle incluant les deux prédicteurs.
Si notre motivation est d’optimiser la prédiction, une stratégie possible
consiste à calculer les 2
m modèles envisageables et à choisir celui pour lequel
notre critère ˜
σ ε ·
1 + (m + 1)/n est minimisé. Afin d’économiser du temps de
calcul, on ne considère parfois qu’un sous-ensemble de ces 2
m modèles. Une méthode souvent utilisée consiste à calculer tout d’abord le modèle avec l’ensemble
des m prédicteurs, puis à éliminer le prédicteur associé à la plus grande valeur
p et à continuer ainsi jusqu’à ce que toutes les valeurs p soient plus petites
que 0.157. En anglais, il s’agit de la méthode backward elimination
30 . En
utilisant cette méthode, on n’est pas sûr d’identifier le meilleur modèle, mais
on trouvera souvent « un bon modèle ». On pourra utiliser la même méthode
en utilisant un seuil de 0.05 au lieu de 0.157 si notre motivation est l’identification d’un ensemble de prédicteurs importants (ni inutiles, ni redondants). Par
contre, une telle méthode ne doit pas être utilisée si notre motivation est l’estimation d’une association ajustée pour les variables confondantes (où le choix
des prédicteurs à inclure dans le modèle dépend de la question scientifique posée
et non du résultat de tests statistiques).
Exemple 14.17 Appliquons la méthode « backward elimination » décrite cidessus à notre exemple de la prédiction de la graisse corporelle. Dans le modèle
avec les m = 6 prédicteurs, le prédicteur associé à la plus grande valeur p était
la taille (p = 0.240). Si on élimine la taille, on obtient le modèle suivant :
estimation erreur type
t stat valeur p
(constante)
−28.080
7.764 −3.617
0.000
poids
−0.196
0.073 −2.671
0.008
âge
0.044
0.029
1.527
0.128
abdomen
0.899
0.070 12.755
0.000
biceps
0.292
0.152
1.913
0.057
poignet
−1.721
0.495 −3.479
0.001
30 Il existe de nombreuses variantes de cette méthode, par exemple, la méthode dite en
anglais forward selection.
