312
Statistique appliquée aux sciences de la vie
tester la nullité simultanée de r paramètres dans un modèle de régression logistique avec un test du rapport de vraisemblance, on calcule la statistique de
test suivante :
t stat = 2(log L − log L 0 ).
où L dénote la valeur de la vraisemblance qui est maximisée par les estimateurs du maximum de vraisemblance dans notre modèle et L 0 la valeur de
la vraisemblance qui est maximisée par les estimateurs du maximum de vraisemblance dans un modèle qui ne contient pas les r prédicteurs associés aux
paramètres dont on aimerait tester la nullité. Notons que la vraisemblance ne
peut qu’augmenter lorsqu’on introduit de nouveaux prédicteurs dans le modèle, de sorte que l’on aura nécessairement L ≥ L 0 . Si cette augmentation est
trop importante, on rejette l’hypothèse nulle de la nullité des r paramètres en
question. Sous cette hypothèse nulle, la distribution de cette statistique de test
est approximativement une distribution du khi-deux avec r dl. On rejette ainsi
l’hypothèse nulle au seuil α si t stat ≥ χ
2
1−α,r .
On mentionnera finalement que la quantité −2 log L est appelée la déviance
du modèle
22 . Maximiser la vraisemblance revient donc à minimiser la déviance.
Par ailleurs, le critère AIC que l’on avait brièvement mentionné au chapitre
14 en relation avec la problématique du choix d’un modèle de régression pour
optimiser la prédiction, consiste à « pénaliser » la déviance d’un modèle en lui
additionant deux fois le nombre de ses paramètres. On aura ainsi :
AIC = −2 log L + 2(m + 1).
Dans le but d’optimiser la prédiction en régression logistique, une stratégie
consiste à choisir un modèle minimisant AIC. L’introduction d’un prédicteur
dans un modèle diminuera la valeur de AIC si la statistique de test d’un test
du rapport de vraisemblance sur la nullité de la pente associée à ce prédicteur
est plus grande que 2 (et donc la valeur p plus petite que 0.157). On avait un
résultat semblable en utilisant la stratégie qui consistait à minimiser la longueur
des intervalles de prédiction pour le choix d’un modèle en régression linéaire.
22 La statistique de test d’un test du rapport de vraisemblance est donc la différence des
déviances des deux modèles que l’on compare. Dans R, on obtient la déviance d’un modèle de
régression logistique multiple avec une variable réponse binaire y et des prédicteurs x1, x2,
x3, x4 et x5 en utilisant la commande glm(y∼x1+x2+x3+x4+x5,family=binomial)$deviance.
Statistique appliquée aux sciences de la vie
tester la nullité simultanée de r paramètres dans un modèle de régression logistique avec un test du rapport de vraisemblance, on calcule la statistique de
test suivante :
t stat = 2(log L − log L 0 ).
où L dénote la valeur de la vraisemblance qui est maximisée par les estimateurs du maximum de vraisemblance dans notre modèle et L 0 la valeur de
la vraisemblance qui est maximisée par les estimateurs du maximum de vraisemblance dans un modèle qui ne contient pas les r prédicteurs associés aux
paramètres dont on aimerait tester la nullité. Notons que la vraisemblance ne
peut qu’augmenter lorsqu’on introduit de nouveaux prédicteurs dans le modèle, de sorte que l’on aura nécessairement L ≥ L 0 . Si cette augmentation est
trop importante, on rejette l’hypothèse nulle de la nullité des r paramètres en
question. Sous cette hypothèse nulle, la distribution de cette statistique de test
est approximativement une distribution du khi-deux avec r dl. On rejette ainsi
l’hypothèse nulle au seuil α si t stat ≥ χ
2
1−α,r .
On mentionnera finalement que la quantité −2 log L est appelée la déviance
du modèle
22 . Maximiser la vraisemblance revient donc à minimiser la déviance.
Par ailleurs, le critère AIC que l’on avait brièvement mentionné au chapitre
14 en relation avec la problématique du choix d’un modèle de régression pour
optimiser la prédiction, consiste à « pénaliser » la déviance d’un modèle en lui
additionant deux fois le nombre de ses paramètres. On aura ainsi :
AIC = −2 log L + 2(m + 1).
Dans le but d’optimiser la prédiction en régression logistique, une stratégie
consiste à choisir un modèle minimisant AIC. L’introduction d’un prédicteur
dans un modèle diminuera la valeur de AIC si la statistique de test d’un test
du rapport de vraisemblance sur la nullité de la pente associée à ce prédicteur
est plus grande que 2 (et donc la valeur p plus petite que 0.157). On avait un
résultat semblable en utilisant la stratégie qui consistait à minimiser la longueur
des intervalles de prédiction pour le choix d’un modèle en régression linéaire.
22 La statistique de test d’un test du rapport de vraisemblance est donc la différence des
déviances des deux modèles que l’on compare. Dans R, on obtient la déviance d’un modèle de
régression logistique multiple avec une variable réponse binaire y et des prédicteurs x1, x2,
x3, x4 et x5 en utilisant la commande glm(y∼x1+x2+x3+x4+x5,family=binomial)$deviance.
