16. Régression logistique
293
• pour la pente associée au prédicteur X 2 , on a pour n’importe quelle
valeur de x 2 :
β 2 = log
odds(Y |X 1 = x 1 , X 2 = x 2 + 1, · · · , X m = x m )
odds(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m )
c’est-à-dire :
exp(β 2 ) =
odds(Y |X 1 = x 1 , X 2 = x 2 + 1, · · · , X m = x m )
odds(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m )
→ la pente associée à X 2 est le logarithme de l’odds-ratio comparant les
odds d’avoir Y = 1 entre deux groupes qui diffèrent d’une unité par rapport à X 2 , et qui sont identiques par rapport à tous les autres prédicteurs
→ interprétation similaire pour toutes les pentes.
Ici aussi, les estimateurs
β 0 ,
β 1 , · · · ,
β m des véritables paramètres β 0 , β 1 ,
· · · , β m d’un modèle de régression logistique multiple sont calculés à partir des
données observées dans notre échantillon, que l’on supposera indépendantes, en
utilisant la méthode non explicite du maximum de vraisemblance. La probabilité d’avoir Y = 1 dans le groupe X 1 = x 1 , · · · , X m = x m , d’après le modèle
égale à exp(β 0 +β 1 x 1 +· · ·+β m x m )/(1+exp(β 0 +β 1 x 1 +· · ·+β m x m )), est donc
estimée par exp(
β 0 +
β 1 x 1 + · · · +
β m x m )/(1 + exp(
β 0 +
β 1 x 1 + · · · +
β m x m )).
On aura également des estimations des erreurs types des estimateurs des paramètres du modèle, et on pourra utiliser la méthode de Wald pour calculer des
intervalles de confiance pour ces paramètres et effectuer des tests statistiques
(qui ne seront pas exacts). Alternativement, on pourra effectuer des tests du
rapport de vraisemblance, que l’on pourra également utiliser pour tester la
nullité simultanée de plusieurs paramètres dans le modèle.
Exemple 16.7 On considère un exemple de régression logistique calculé à partir de n = 3141 individus dont on a mesuré l’âge X 1 (en années), le cholestérol
X 2 (en mg/dL), la pression systolique X 3 (en mmHg), le bmi X 4 (le poids divisé par la taille au carré, en kg/m
2 ) et le tabac X 5 (X 5 = 1 pour les fumeurs et
X 5 = 0 pour les non-fumeurs). La variable réponse Y est à nouveau la présence
ou l’absence d’une maladie coronarienne (Y = 1 pour les malades et Y = 0
pour les non-malades). On a les résultats suivants
8 :
8 Nous reproduisons ici le tableau 6.6 du livre de Vittinghoff et al. (2005). Notons aussi que
dans R, on peut obtenir les résultats d’un modèle de régression logistique multiple avec une
variable réponse binaire y et cinq prédicteurs x1, x2, x3, x4 et x5 en utilisant la commande
summary(glm(y∼x1+x2+x3+x4+x5,family=binomial)).
293
• pour la pente associée au prédicteur X 2 , on a pour n’importe quelle
valeur de x 2 :
β 2 = log
odds(Y |X 1 = x 1 , X 2 = x 2 + 1, · · · , X m = x m )
odds(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m )
c’est-à-dire :
exp(β 2 ) =
odds(Y |X 1 = x 1 , X 2 = x 2 + 1, · · · , X m = x m )
odds(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m )
→ la pente associée à X 2 est le logarithme de l’odds-ratio comparant les
odds d’avoir Y = 1 entre deux groupes qui diffèrent d’une unité par rapport à X 2 , et qui sont identiques par rapport à tous les autres prédicteurs
→ interprétation similaire pour toutes les pentes.
Ici aussi, les estimateurs
β 0 ,
β 1 , · · · ,
β m des véritables paramètres β 0 , β 1 ,
· · · , β m d’un modèle de régression logistique multiple sont calculés à partir des
données observées dans notre échantillon, que l’on supposera indépendantes, en
utilisant la méthode non explicite du maximum de vraisemblance. La probabilité d’avoir Y = 1 dans le groupe X 1 = x 1 , · · · , X m = x m , d’après le modèle
égale à exp(β 0 +β 1 x 1 +· · ·+β m x m )/(1+exp(β 0 +β 1 x 1 +· · ·+β m x m )), est donc
estimée par exp(
β 0 +
β 1 x 1 + · · · +
β m x m )/(1 + exp(
β 0 +
β 1 x 1 + · · · +
β m x m )).
On aura également des estimations des erreurs types des estimateurs des paramètres du modèle, et on pourra utiliser la méthode de Wald pour calculer des
intervalles de confiance pour ces paramètres et effectuer des tests statistiques
(qui ne seront pas exacts). Alternativement, on pourra effectuer des tests du
rapport de vraisemblance, que l’on pourra également utiliser pour tester la
nullité simultanée de plusieurs paramètres dans le modèle.
Exemple 16.7 On considère un exemple de régression logistique calculé à partir de n = 3141 individus dont on a mesuré l’âge X 1 (en années), le cholestérol
X 2 (en mg/dL), la pression systolique X 3 (en mmHg), le bmi X 4 (le poids divisé par la taille au carré, en kg/m
2 ) et le tabac X 5 (X 5 = 1 pour les fumeurs et
X 5 = 0 pour les non-fumeurs). La variable réponse Y est à nouveau la présence
ou l’absence d’une maladie coronarienne (Y = 1 pour les malades et Y = 0
pour les non-malades). On a les résultats suivants
8 :
8 Nous reproduisons ici le tableau 6.6 du livre de Vittinghoff et al. (2005). Notons aussi que
dans R, on peut obtenir les résultats d’un modèle de régression logistique multiple avec une
variable réponse binaire y et cinq prédicteurs x1, x2, x3, x4 et x5 en utilisant la commande
summary(glm(y∼x1+x2+x3+x4+x5,family=binomial)).
