16. Régression logistique
305
si la prévalence est de 0.005 et de :
0.8 · (1 − 0.2)
0.8 · (1 − 0.2) + (1 − 0.9) · 0.2
= 0.97
si la prévalence est de 0.2.
Un bon diagnostic est un diagnostic avec une grande sensibilité et une
grande spécificité. Si un diagnostic est établi à partir d’un modèle de régression logistique, la sensibilité et la spécificité dépendront de la limite critique C
utilisée ci-dessus. On pourra augmenter la sensibilité en abaissant cette limite
critique, mais cela se fera au détriment de la spécificité qui dans le même temps
baissera. Dans le cas extrême C = 0, on diagnostiquera la maladie chez tout
le monde, de sorte que la sensibilité sera de 100 % et la spécificité de 0 %. De
même, on pourra augmenter la spécificité en élevant cette limite critique, mais
cela se fera au détriment de la sensibilité qui dans le même temps baissera.
Dans le cas extrême C = 1, on ne diagnostiquera la maladie chez personne, de
sorte que la spécificité sera de 100 % et la sensibilité de 0 %. Le choix d’une
limite critique C est donc un compromis entre sensibilité et spécificité. Dans
certaines applications, la sensibilité sera plus importante que la spécificité et
on choisira ainsi une limite critique basse. Dans d’autres, la spécificité sera plus
importante que la sensibilité et on choisira une limite critique élevée.
On peut mesurer la qualité globale de la prédiction d’un modèle de régression logistique en mesurant la qualité globale de ces différents diagnostics que
l’on peut établir à l’aide de ce modèle. Une mesure souvent utilisée est l’aire
sous la courbe ROC, que l’on calcule comme suit
14 :
• à partir des données de l’échantillon, on estime la sensibilité et la
spécificité que l’on peut atteindre en choisissant les différentes limites
critiques données par C =
π i (pour i = 1, · · · , n)
→ on obtient des estimations de (au plus) n couples possibles (1 −
spécificité, sensibilité)
→ on y ajoute les deux couples suivants : (1,1) (obtenu avec C = 0) et
(0,0) (obtenu avec C = 1)
• on représente ces différents couples possibles par des points sur un
graphique (où l’axe horizontal représente 1− la spécificité et l’axe vertical
représente la sensibilité) et on relie ces points par des segments
→ la courbe ainsi obtenue est une estimation de la courbe ROC (de
l’anglais : Receiver Operating Characteristic)
→ d’une manière générale, les diagnostics que l’on peut établir à l’aide du
modèle seront d’autant meilleurs que cette courbe sera loin (au-dessus)
de la diagonale
14 D’autres mesures de la qualité globale de la prédiction en régression logistique on été
proposées, voir par exemple l’article de Mittlböck et Schemper (1996).
Précédent

- 312/327

Suivant