16. Régression logistique
289
Alors que les paramètres d’un modèle de régression linéaire pour une variable
réponse binaire seraient interprétables comme proportions et différences de proportion, les paramètres d’un modèle de régression logistique pour une variable
réponse binaire sont donc interprétables en terme d’odds et d’odds-ratio.
Notons que les hypothèses d’homoscédasticité et de normalité que l’on fait
habituellement dans un modèle de régression linéaire ne sont pas non plus satisfaites avec une variable réponse binaire. D’une part, la variance d’une variable
binaire dépend par définition de sa moyenne et donc ne sera pas constante si la
moyenne ne l’est pas. D’autre part, une variable binaire n’est évidemment pas
normale. Un modèle de régression logistique sera donc uniquement constitué
d’une hypothèse de linéarité (sur l’échelle du logit)
4 , ainsi que d’une hypothèse
sur l’indépendance des observations
5 .
Les estimateurs
β 0 et
β 1 des véritables paramètres β 0 et β 1 d’un modèle
de régression logistique sont calculés à partir des données observées dans notre
échantillon non pas en utilisant la méthode des moindres carrés, mais la méthode dite du maximum de vraisemblance que nous introduirons brièvement en
fin de chapitre. La probabilité d’avoir Y = 1 dans le groupe X = x, d’après
le modèle égale à exp(β 0 + β 1 x)/(1 + exp(β 0 + β 1 x)), est donc estimée par
exp(
β 0 +
β 1 x)/(1 + exp(
β 0 +
β 1 x)). Contrairement à la méthode des moindres
carrés, on n’a pas de formule explicite pour
β 0 et
β 1 (à part dans certains cas
particuliers). Un logiciel statistique sera donc ici indispensable. Il nous donnera
également des estimations des erreurs types des estimateurs des paramètres du
modèle. Grâce à la normalité approximative de ces estimateurs, on pourra utiliser la méthode de Wald pour calculer des intervalles de confiance pour ces
paramètres et effectuer des tests statistiques, qui ne seront pas exacts cependant. Des tests statistiques dits tests du rapport de vraisemblance, qui auront en
général une meilleure validité que les tests de Wald, sont également disponibles.
Exemple 16.5 On considère un exemple avec n = 100 individus adultes dont
on a mesuré l’âge X (en années) et la présence ou l’absence Y d’une maladie
4 Alors que l’on considère dans un modèle de régression linéaire une variable Y |X = x
normale avec moyenne β 0 + β 1 x et variance σ 2 , on considère dans un modèle de régression
logistique une variable Y |X = x binaire avec moyenne (ou proportion) exp(β 0 + β 1 x)/(1 +
exp(β 0 + β 1 x)). Il s’agit de deux cas particuliers de ce que l’on appelle un modèle linéaire
généralisé (en anglais : generalized linear model). Dans un tel modèle, on postule une
forme générale pour la distribution de la variable Y |X = x et on suppose qu’une fonction de
sa moyenne dépend linéairement de x.
5 Il y a plusieurs façons de spécifier cette hypothèse d’indépendance en régression logistique, qui correspondent à différentes façons d’échantillonner les données. On peut supposer
n observations indépendantes de la variable Y pour des individus avec des valeurs x i choisies
par nous-mêmes, comme on l’a vu en régression linéaire (on aura alors une indépendance
conditionnelle aux valeurs x i de notre échantillon). Dans une étude cas-témoins, on suppose par contre n observations indépendantes de la variable X pour des individus avec des
valeurs y i choisies par nous-mêmes, ce que nous n’avions pas en régression linéaire (indépendance conditionnelle aux valeurs y i de notre échantillon). Finalement, on peut supposer n
observations indépendantes de la variable bivariée (X, Y ).
Précédent

- 296/327

Suivant