16. Régression logistique
287
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(a) cst= −2 pente= 1
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(b) cst= −2 pente= 2
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(c) cst= −1 pente= −1
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(d) cst= 0 pente= 3
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(e) cst= 0 pente= 10
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(f) cst= 1 pente= 0
Figure 16.2 – Exemples de fonctions logistiques.
• pour la pente : β 1 = proportion(Y |X = x + 1) − proportion(Y |X = x)
→ la pente serait une différence des proportions entre deux groupes qui
diffèrent d’une unité par rapport à X.
Notons cependant que la proportion β 0 + β 1 x prédite pour le groupe X = x
pourrait être plus petite que 0 ou plus grande que 1 (selon les valeurs de β 0 ,
β 1 et x), ce qui est absurde. Cela est la raison pour laquelle l’hypothèse de
linéarité n’est souvent pas réaliste pour une variable binaire.
Afin de définir un modèle qui soit réaliste, il faudra remplacer l’hypothèse
de linéarité ci-dessus par une autre hypothèse. On supposera ainsi que les
moyennes (ou proportions) de Y dans les différents groupes définis par X = x
se trouvent non pas sur une droite, mais sur une courbe bornée entre 0 et
1. En régression logistique, on considère une courbe dite logistique d’équation
exp(β 0 + β 1 x)/(1 + exp(β 0 + β 1 x)). La figure 16.2 nous en montre quelques
exemples (avec différentes valeurs pour β 0 et β 1 ). Une fonction logistique est
une fonction monotone croissante de 0 vers 1 si β 1 > 0, monotone décroissante
de 1 vers 0 si β 1 < 0, et constante si β 1 = 0.
Dans un modèle de régression logistique, on fait ainsi l’hypothèse suivante :
proportion(Y |X = x) =
exp(β 0 + β 1 x)
1 + exp(β 0 + β 1 x)
.
287
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(a) cst= −2 pente= 1
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(b) cst= −2 pente= 2
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(c) cst= −1 pente= −1
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(d) cst= 0 pente= 3
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(e) cst= 0 pente= 10
−1.0 −0.5 0.0
0.5
1.0
0.0
0.2
0.4
0.6
0.8
1.0
(f) cst= 1 pente= 0
Figure 16.2 – Exemples de fonctions logistiques.
• pour la pente : β 1 = proportion(Y |X = x + 1) − proportion(Y |X = x)
→ la pente serait une différence des proportions entre deux groupes qui
diffèrent d’une unité par rapport à X.
Notons cependant que la proportion β 0 + β 1 x prédite pour le groupe X = x
pourrait être plus petite que 0 ou plus grande que 1 (selon les valeurs de β 0 ,
β 1 et x), ce qui est absurde. Cela est la raison pour laquelle l’hypothèse de
linéarité n’est souvent pas réaliste pour une variable binaire.
Afin de définir un modèle qui soit réaliste, il faudra remplacer l’hypothèse
de linéarité ci-dessus par une autre hypothèse. On supposera ainsi que les
moyennes (ou proportions) de Y dans les différents groupes définis par X = x
se trouvent non pas sur une droite, mais sur une courbe bornée entre 0 et
1. En régression logistique, on considère une courbe dite logistique d’équation
exp(β 0 + β 1 x)/(1 + exp(β 0 + β 1 x)). La figure 16.2 nous en montre quelques
exemples (avec différentes valeurs pour β 0 et β 1 ). Une fonction logistique est
une fonction monotone croissante de 0 vers 1 si β 1 > 0, monotone décroissante
de 1 vers 0 si β 1 < 0, et constante si β 1 = 0.
Dans un modèle de régression logistique, on fait ainsi l’hypothèse suivante :
proportion(Y |X = x) =
exp(β 0 + β 1 x)
1 + exp(β 0 + β 1 x)
.
