308
Statistique appliquée aux sciences de la vie
problématique. Bien que différentes façons de standardiser ces résidus aient été
proposées dans la littérature, il n’est pas évident de reconnaître des résidus qui
sont en accord avec les hypothèses du modèle, de résidus qui ne le sont pas.
Dans le but de vérifier l’hypothèse de linéarité en régression logistique, une
possibilité est de regrouper les individus selon leurs probabilités estimées
π i
(les individus avec des
π i semblables se retrouvant dans un même groupe). On
pourra alors comparer les proportions empiriques (la moyenne des y i ) et les
proportions prédites (la moyenne des
π i ) de Y = 1 dans ces différents groupes.
Une différence trop grande entre ces proportions dans l’un ou l’autre de ces
groupes indiquera un défaut du modèle
17 .
Exemple 16.13 On reprend les données de l’étude cas-témoins où l’on prédit
la présence d’un cancer de la cavité buccale en fonction de la consommation
de tabac et d’alcool. On a ici 16 groupes naturels (correspondant aux 16 combinaisons de valeurs possibles des prédicteurs). Dans chacun de ces groupes,
on compare la proportion empirique de malades (la moyenne des y i ) avec la
proportion de malades prédite par le modèle (la moyenne des
π i ). On a les résultats suivants (les proportions prédites sont données entre parenthèses et sont
calculées à partir du modèle avec prédicteurs quantitatifs) :
tabac
alcool
0
1 –19
20–39
40+
0
0.21 (0.16) 0.30 (0.24) 0.27 (0.33) 0.53 (0.43)
1–9
0.21 (0.24) 0.31 (0.33) 0.45 (0.44) 0.46 (0.55)
10–44 0.25 (0.34) 0.53 (0.45) 0.55 (0.56) 0.66 (0.67)
45+
0.38 (0.46) 0.51 (0.57) 0.71 (0.68) 0.77 (0.77)
La plus grande différence entre proportion empirique et proportion prédite de
malades est ainsi de 10 %, que l’on trouve dans le groupe des non-buveurs
et grands fumeurs où l’on observe 53 % de malades, alors que le modèle n’en
prédit que 43 %. Cette différence de 10 % n’est cependant pas énorme et ne se
retrouve pas dans les groupes adjacents, de sorte que notre modèle apparaît être
une approximation satisfaisante de la réalité
18 .
On terminera cette section en mentionnant un résultat remarquable. Un modèle de régression logistique pour une variable réponse binaire Y avec comme
17 Des tests statistiques ont été proposés pour nous aider à décider si une telle différence est
acceptable ou non (par exemple le test de Hosmer-Lemeshow). On rappelle toutefois qu’un
modèle de régression ne sera en général qu’une approximation de la réalité, et donc faux au
sens strict du terme, de sorte que même un bon modèle pourra être rejeté statistiquement si
l’échantillon dans lequel il est calculé est suffisamment grand.
18 Rappelons que dans le cadre d’une étude cas-témoins, les b
π i ne sont certes pas des
estimations valides des probabilités d’avoir la maladie dans les différents groupes. On a donc
ici vérifié le modèle dans le cadre d’un échantillon non représentatif de la population d’intérêt,
où les malades sont sur-représentés. Cela est cependant suffisant pour obtenir des estimations
valides des odds-ratios dans la population d’intérêt (comme expliqué en début de chapitre).
Précédent

- 315/327

Suivant