16. Régression logistique
291
Notons que l’odds-ratio comparant les odds d’avoir la maladie entre deux groupes
d’individus avec 10 ans d’écart est estimé à exp(10 · 0.111) = 3.034 avec un intervalle de confiance de :
exp(10 · 0.111 ± 1.96 · 10 · 0.024) = [1.890; 4.857].
La proportion de malades (la probabilité d’être malade) en fonction de l’âge x
est par ailleurs estimée par la fonction exp(−5.309+0.111x)/(1+exp(−5.309+
0.111x)) qui est également représentée dans la figure 16.3. Par exemple, la
probabilité d’être malade pour un individu âgé de 30 ans est estimée par :
exp(−5.309 + 0.111 · 30)
1 + exp(−5.309 + 0.111 · 30)
= 0.12
et la probabilité d’être malade pour un individu âgé de 60 ans par :
exp(−5.309 + 0.111 · 60)
1 + exp(−5.309 + 0.111 · 60)
= 0.79.
Exemple 16.6 Si on calcule un modèle de régression logistique pour les données de notre étude cas-témoins ci-dessus avec comme prédicteur X le tabac
(X = 1 pour les fumeurs et X = 0 pour les non-fumeurs) et comme variable
réponse Y la maladie (Y = 1 pour les malades et Y = 0 pour les non-malades),
on obtient :
estimation erreur type
t stat
valeur p
(constante)
−2.165
0.399
−5.425
0.000
tabac
2.206
0.401
5.502
0.000
L’odds-ratio comparant les odds d’être malade entre les fumeurs et les nonfumeurs est donc estimé à exp(2.206) = 9.1, avec une erreur type de 0.401
pour son logarithme, ce qui correspond exactement à ce que l’on a calculé avec la
méthode de la section précédente (qui était donc un cas particulier de régression
logistique avec un prédicteur binaire). Attention, dans une étude cas-témoins,
seule la pente d’un modèle de régression logistique aura du sens. Si les individus
avec Y = 1 sont sur-représentés dans l’échantillon, on ne pourra pas interpréter
la constante du modèle, ni estimer de probabilités d’avoir la maladie.
16.5 Régression logistique multiple
On va à présent généraliser le modèle de régression logistique simple de
la section précédente à un modèle de régression logistique multiple, où l’on
considère plusieurs prédicteurs (continus ou binaires) notés X 1 , X 2 , · · · , X m .
L’hypothèse de linéarité consiste à supposer que les logarithmes des odds d’avoir
291
Notons que l’odds-ratio comparant les odds d’avoir la maladie entre deux groupes
d’individus avec 10 ans d’écart est estimé à exp(10 · 0.111) = 3.034 avec un intervalle de confiance de :
exp(10 · 0.111 ± 1.96 · 10 · 0.024) = [1.890; 4.857].
La proportion de malades (la probabilité d’être malade) en fonction de l’âge x
est par ailleurs estimée par la fonction exp(−5.309+0.111x)/(1+exp(−5.309+
0.111x)) qui est également représentée dans la figure 16.3. Par exemple, la
probabilité d’être malade pour un individu âgé de 30 ans est estimée par :
exp(−5.309 + 0.111 · 30)
1 + exp(−5.309 + 0.111 · 30)
= 0.12
et la probabilité d’être malade pour un individu âgé de 60 ans par :
exp(−5.309 + 0.111 · 60)
1 + exp(−5.309 + 0.111 · 60)
= 0.79.
Exemple 16.6 Si on calcule un modèle de régression logistique pour les données de notre étude cas-témoins ci-dessus avec comme prédicteur X le tabac
(X = 1 pour les fumeurs et X = 0 pour les non-fumeurs) et comme variable
réponse Y la maladie (Y = 1 pour les malades et Y = 0 pour les non-malades),
on obtient :
estimation erreur type
t stat
valeur p
(constante)
−2.165
0.399
−5.425
0.000
tabac
2.206
0.401
5.502
0.000
L’odds-ratio comparant les odds d’être malade entre les fumeurs et les nonfumeurs est donc estimé à exp(2.206) = 9.1, avec une erreur type de 0.401
pour son logarithme, ce qui correspond exactement à ce que l’on a calculé avec la
méthode de la section précédente (qui était donc un cas particulier de régression
logistique avec un prédicteur binaire). Attention, dans une étude cas-témoins,
seule la pente d’un modèle de régression logistique aura du sens. Si les individus
avec Y = 1 sont sur-représentés dans l’échantillon, on ne pourra pas interpréter
la constante du modèle, ni estimer de probabilités d’avoir la maladie.
16.5 Régression logistique multiple
On va à présent généraliser le modèle de régression logistique simple de
la section précédente à un modèle de régression logistique multiple, où l’on
considère plusieurs prédicteurs (continus ou binaires) notés X 1 , X 2 , · · · , X m .
L’hypothèse de linéarité consiste à supposer que les logarithmes des odds d’avoir
