302
Statistique appliquée aux sciences de la vie
Exemple 16.10 On reprend l’exemple de l’essai clinique ci-dessus où l’on
s’intéresse à l’effet de la technique X 1 de l’opération (X 1 = 1 pour la nouvelle
technique, X 1 = 0 pour l’ancienne technique) sur la réussite Y de l’opération
(Y = 1 pour un succès, Y = 0 pour un échec). En calculant un modèle de
régression logistique où l’on prédit Y à partir de X 1 , on obtient :
estimation erreur type
t stat valeur p
(constante)
−0.465
0.110 −4.238
0.000
technique
1.765
0.170 10.357
0.000
On estime ainsi l’effet de la technique d’opération sur la réussite de l’opération
via un odds-ratio de exp(1.765) = 5.84. En introduisant toutefois la taille X 2
du calcul (avec X 2 = 1 pour un gros calcul, X 2 = 0 pour un petit calcul) dans
le modèle, on obtient :
estimation erreur type
t stat valeur p
(constante)
0.000
0.122
0.000
1.000
technique
2.197
0.208 10.575
0.000
taille
−2.197
0.225 −9.755
0.000
En comparant à taille de calcul égale, on estime à présent un effet de la technique d’opération sur la réussite de l’opération via un odds-ratio de exp(2.197) =
9, ce qui correspond à un plus grand effet que dans le premier modèle (bien que
le prédicteur X 2 introduit dans ce second modèle soit non corrélé avec X 1 ).
16.8 Sensibilité, spécificité et courbe ROC
Afin d’obtenir une mesure de la qualité globale de la prédiction en régression
linéaire, on calculait (une version corrigée du carré de) la corrélation entre les
y i et les
y
∗
i , où y i dénotait la valeur observée et
y
∗
i la valeur prédite de la
variable réponse Y pour le i-ième individu de notre échantillon (i = 1, · · · , n).
En régression logistique, les valeurs observées y i sont binaires. Afin d’obtenir
des valeurs prédites
y
∗
i qui sont également binaires, on calculera tout d’abord
les « probabilités estimées » données par :
π i =
exp(
β 0 +
β 1 x i1 +
β 2 x i2 + · · · +
β m x im )
1 + exp(
β 0 +
β 1 x i1 +
β 2 x i2 + · · · +
β m x im )
.
La quantité
π i est une estimation de la probabilité d’avoir Y = 1 pour des
individus semblables au i-ième individu de notre échantillon par rapport aux
valeurs des prédicteurs (où x ij dénote la valeur du j-ième prédicteur pour le
i-ième individu de notre échantillon, pour i = 1, · · · , n et j = 1, · · · , m). On
dichotomisera ensuite ces probabilités estimées de la façon suivante :
•
y
∗
i = 1 si
π i ≥ C
Statistique appliquée aux sciences de la vie
Exemple 16.10 On reprend l’exemple de l’essai clinique ci-dessus où l’on
s’intéresse à l’effet de la technique X 1 de l’opération (X 1 = 1 pour la nouvelle
technique, X 1 = 0 pour l’ancienne technique) sur la réussite Y de l’opération
(Y = 1 pour un succès, Y = 0 pour un échec). En calculant un modèle de
régression logistique où l’on prédit Y à partir de X 1 , on obtient :
estimation erreur type
t stat valeur p
(constante)
−0.465
0.110 −4.238
0.000
technique
1.765
0.170 10.357
0.000
On estime ainsi l’effet de la technique d’opération sur la réussite de l’opération
via un odds-ratio de exp(1.765) = 5.84. En introduisant toutefois la taille X 2
du calcul (avec X 2 = 1 pour un gros calcul, X 2 = 0 pour un petit calcul) dans
le modèle, on obtient :
estimation erreur type
t stat valeur p
(constante)
0.000
0.122
0.000
1.000
technique
2.197
0.208 10.575
0.000
taille
−2.197
0.225 −9.755
0.000
En comparant à taille de calcul égale, on estime à présent un effet de la technique d’opération sur la réussite de l’opération via un odds-ratio de exp(2.197) =
9, ce qui correspond à un plus grand effet que dans le premier modèle (bien que
le prédicteur X 2 introduit dans ce second modèle soit non corrélé avec X 1 ).
16.8 Sensibilité, spécificité et courbe ROC
Afin d’obtenir une mesure de la qualité globale de la prédiction en régression
linéaire, on calculait (une version corrigée du carré de) la corrélation entre les
y i et les
y
∗
i , où y i dénotait la valeur observée et
y
∗
i la valeur prédite de la
variable réponse Y pour le i-ième individu de notre échantillon (i = 1, · · · , n).
En régression logistique, les valeurs observées y i sont binaires. Afin d’obtenir
des valeurs prédites
y
∗
i qui sont également binaires, on calculera tout d’abord
les « probabilités estimées » données par :
π i =
exp(
β 0 +
β 1 x i1 +
β 2 x i2 + · · · +
β m x im )
1 + exp(
β 0 +
β 1 x i1 +
β 2 x i2 + · · · +
β m x im )
.
La quantité
π i est une estimation de la probabilité d’avoir Y = 1 pour des
individus semblables au i-ième individu de notre échantillon par rapport aux
valeurs des prédicteurs (où x ij dénote la valeur du j-ième prédicteur pour le
i-ième individu de notre échantillon, pour i = 1, · · · , n et j = 1, · · · , m). On
dichotomisera ensuite ces probabilités estimées de la façon suivante :
•
y
∗
i = 1 si
π i ≥ C
