286
Statistique appliquée aux sciences de la vie
Un intervalle de confiance au niveau 1 − α pour ω s’obtient en calculant l’exponentielle de ces bornes.
Exemple 16.4 Dans notre étude cas-témoins ci-dessus, on a un odds-ratio
empirique de
ω = 9.1, ce qui implique log( ω) = 2.206. L’erreur type de cet
estimateur est estimée par :
1
1350
+
1
61
+
1
1296
+
1
7
= 0.401.
On calcule un intervalle de confiance au niveau 95 % pour log(ω) comme suit :
2.206 ± 1.96 · 0.401 = [1.420; 2.290].
Un intervalle de confiance au niveau 95 % pour le véritable odds-ratio ω est
alors donné par :
[exp(1.420); exp(2.290)] = [4.1; 19.9].
On a donc prouvé statistiquement que l’odds de développer la maladie chez les
fumeurs est au moins 4.1 fois plus grand que l’odds de développer la maladie
chez les non-fumeurs. Comme il s’agit ici d’une maladie rare (même chez les
fumeurs), les probabilités de développer cette maladie seront petites, les odds
seront proches des probabilités et l’odds-ratio sera proche du ratio des probabilités. On peut donc dire que l’on a prouvé statistiquement que les fumeurs ont
un risque au moins 4.1 plus élevé que les non-fumeurs de développer la maladie
(bien que l’on ne connaisse pas la valeur absolue de ce risque).
16.4 Régression logistique simple
On va voir à présent comment définir un modèle de régression simple pour
prédire une variable réponse Y binaire à partir d’un prédicteur X. Rappelons
tout d’abord que dans un modèle de régression linéaire, l’hypothèse de linéarité consiste à supposer que les moyennes de la variable Y calculées dans les
différents groupes définis par les différentes valeurs possibles x de X sont alignées sur une droite d’équation β 0 + β 1 x (la droite de régression). Rappelons
ensuite que la moyenne d’une variable binaire est une proportion. En utilisant
un modèle de régression linéaire pour une variable réponse Y binaire, on aurait ainsi l’interprétation suivante pour les paramètres β 0 et β 1 de la droite de
régression :
• pour la constante : β 0 = proportion(Y |X = 0)
→ la constante serait la proportion (d’individus avec Y = 1) dans le
groupe particulier défini par X = 0
Statistique appliquée aux sciences de la vie
Un intervalle de confiance au niveau 1 − α pour ω s’obtient en calculant l’exponentielle de ces bornes.
Exemple 16.4 Dans notre étude cas-témoins ci-dessus, on a un odds-ratio
empirique de
ω = 9.1, ce qui implique log( ω) = 2.206. L’erreur type de cet
estimateur est estimée par :
1
1350
+
1
61
+
1
1296
+
1
7
= 0.401.
On calcule un intervalle de confiance au niveau 95 % pour log(ω) comme suit :
2.206 ± 1.96 · 0.401 = [1.420; 2.290].
Un intervalle de confiance au niveau 95 % pour le véritable odds-ratio ω est
alors donné par :
[exp(1.420); exp(2.290)] = [4.1; 19.9].
On a donc prouvé statistiquement que l’odds de développer la maladie chez les
fumeurs est au moins 4.1 fois plus grand que l’odds de développer la maladie
chez les non-fumeurs. Comme il s’agit ici d’une maladie rare (même chez les
fumeurs), les probabilités de développer cette maladie seront petites, les odds
seront proches des probabilités et l’odds-ratio sera proche du ratio des probabilités. On peut donc dire que l’on a prouvé statistiquement que les fumeurs ont
un risque au moins 4.1 plus élevé que les non-fumeurs de développer la maladie
(bien que l’on ne connaisse pas la valeur absolue de ce risque).
16.4 Régression logistique simple
On va voir à présent comment définir un modèle de régression simple pour
prédire une variable réponse Y binaire à partir d’un prédicteur X. Rappelons
tout d’abord que dans un modèle de régression linéaire, l’hypothèse de linéarité consiste à supposer que les moyennes de la variable Y calculées dans les
différents groupes définis par les différentes valeurs possibles x de X sont alignées sur une droite d’équation β 0 + β 1 x (la droite de régression). Rappelons
ensuite que la moyenne d’une variable binaire est une proportion. En utilisant
un modèle de régression linéaire pour une variable réponse Y binaire, on aurait ainsi l’interprétation suivante pour les paramètres β 0 et β 1 de la droite de
régression :
• pour la constante : β 0 = proportion(Y |X = 0)
→ la constante serait la proportion (d’individus avec Y = 1) dans le
groupe particulier défini par X = 0
