16. Régression logistique
307
prédicteurs, pour lesquels on a les valeurs de
π i suivantes (on utilise ici le
modèle avec prédicteurs quantitatifs) :
tabac
alcool
0
1–19 20–39 40+
0
0.164 0.236 0.326 0.432
1–9
0.243 0.335 0.441 0.554
10–44 0.343 0.451 0.563 0.670
45+
0.460 0.573 0.678 0.768
On estime ainsi les couples possibles (1 − spécificité, sensibilité) suivants (en
utilisant ces valeurs de
π i comme valeur critique C) :
C
1 − spécificité sensibilité
C
1 − spécificité sensibilité
0.000
1.000
1.000
0.451
0.459
0.752
0.164
1.000
1.000
0.460
0.423
0.714
0.236
0.915
0.979
0.554
0.405
0.704
0.243
0.857
0.957
0.563
0.362
0.671
0.326
0.796
0.942
0.573
0.253
0.547
0.335
0.716
0.915
0.670
0.208
0.503
0.343
0.638
0.882
0.678
0.177
0.447
0.432
0.611
0.874
0.768
0.060
0.188
0.441
0.593
0.855
1.000
0.000
0.000
La courbe ROC de la figure 16.4 nous montre ces quantités. On peut ensuite
calculer l’aire sous cette courbe, qui est égale à 0.706. Cette aire sous la courbe
représente une mesure de la qualité globale de la prédiction pour ce modèle de
régression logistique
16 .
16.9 Vérification du modèle
Il est plus difficile de vérifier l’unique hypothèse d’un modèle de régression
logistique que de vérifier les trois hypothèses d’un modèle de régression linéaire
(on met de côté ici les hypothèses d’indépendance). En régression linéaire,
on utilise les résidus y i −
y
∗
i (i = 1, · · · , n) qui ont tous sous les hypothèses
du modèle la même distribution (normale, d’espérance nulle et de même variance). En régression logistique, on pourrait aussi calculer des résidus définis
par y i −
π i (i = 1, · · · , n), mais ces résidus auraient sous les hypothèses du modèle des distributions différentes, de sorte qu’une analyse de ces résidus serait
16 Comme il s’agit d’une étude cas-témoins où les malades sont sur-représentés, les b
π i
calculés ici ne sont pas des estimations valides des probabilités d’avoir la maladie dans les
différents groupes, l’estimation de la constante du modèle n’étant pas valide. Néanmoins, les
couples (1 − spécificité, sensibilité) obtenus seraient les mêmes avec une constante différente
dans le modèle, de sorte que l’estimation de la courbe ROC est valide.
Précédent

- 314/327

Suivant