270
Statistique appliquée aux sciences de la vie
la proportion de jours dans l’année où un individu fume, on aura une plus
grande puissance statistique si on inclut uniquement des individus qui fument
tous les jours (X 1 = 1) et des individus qui ne fument jamais (X 1 = 0) que si
on inclut également des individus qui fument occasionnellement (0 < X 1 < 1).
15.5 Analyse de variance
Un modèle de régression peut donc inclure à la fois des prédicteurs continus
et des prédicteurs binaires, qui sont tous des prédicteurs quantitatifs. On va
voir à présent comment traiter les prédicteurs qualitatifs. Afin d’introduire dans
un modèle de régression un prédicteur qualitatif admettant q valeurs possibles
(définissant q groupes), on procède de la manière suivante :
• on définit q − 1 variables binaires, notées ici par X 1 , X 2 , · · · , X q−1 ,
X j désignant l’appartenance au groupe j (pour j = 1, 2, · · · , q − 1)
→ on aura ainsi
4 :
• groupe
1
: X 1 = 1 X 2 = 0 · · · X q−1 = 0
• groupe
2
: X 1 = 0 X 2 = 1 · · · X q−1 = 0
. . .
. . .
. . .
. . .
. . .
• groupe q − 1
: X 1 = 0 X 2 = 0 · · · X q−1 = 1
• groupe
q
: X 1 = 0 X 2 = 0 · · · X q−1 = 0
• on introduit ces q − 1 variables binaires comme prédicteurs dans
notre modèle de régression linéaire (qui sera donc multiple si q > 2)
→ une variable qualitative avec q valeurs possibles « coûte » q − 1 paramètres dans un modèle de régression.
Dans un modèle de régression, un prédicteur qualitatif avec q modalités
est représenté par q − 1 prédicteurs binaires.
Considérons à présent un modèle de régression avec une variable réponse Y
et un prédicteur qualitatif représenté par ces m = q − 1 prédicteurs binaires.
L’équation de notre hyperplan de régression est donc la suivante :
y
∗ =
β 0 +
β 1 x 1 +
β 2 x 2 + · · · +
β q−1 x q−1 .
4 Notons que, selon les logiciels statistiques, ce sera parfois le premier groupe (et non le
dernier groupe comme nous le faisons ici) qui sera le groupe de référence, c’est-à-dire le groupe
pour lequel chacune des q − 1 variables binaires seront nulles.
Statistique appliquée aux sciences de la vie
la proportion de jours dans l’année où un individu fume, on aura une plus
grande puissance statistique si on inclut uniquement des individus qui fument
tous les jours (X 1 = 1) et des individus qui ne fument jamais (X 1 = 0) que si
on inclut également des individus qui fument occasionnellement (0 < X 1 < 1).
15.5 Analyse de variance
Un modèle de régression peut donc inclure à la fois des prédicteurs continus
et des prédicteurs binaires, qui sont tous des prédicteurs quantitatifs. On va
voir à présent comment traiter les prédicteurs qualitatifs. Afin d’introduire dans
un modèle de régression un prédicteur qualitatif admettant q valeurs possibles
(définissant q groupes), on procède de la manière suivante :
• on définit q − 1 variables binaires, notées ici par X 1 , X 2 , · · · , X q−1 ,
X j désignant l’appartenance au groupe j (pour j = 1, 2, · · · , q − 1)
→ on aura ainsi
4 :
• groupe
1
: X 1 = 1 X 2 = 0 · · · X q−1 = 0
• groupe
2
: X 1 = 0 X 2 = 1 · · · X q−1 = 0
. . .
. . .
. . .
. . .
. . .
• groupe q − 1
: X 1 = 0 X 2 = 0 · · · X q−1 = 1
• groupe
q
: X 1 = 0 X 2 = 0 · · · X q−1 = 0
• on introduit ces q − 1 variables binaires comme prédicteurs dans
notre modèle de régression linéaire (qui sera donc multiple si q > 2)
→ une variable qualitative avec q valeurs possibles « coûte » q − 1 paramètres dans un modèle de régression.
Dans un modèle de régression, un prédicteur qualitatif avec q modalités
est représenté par q − 1 prédicteurs binaires.
Considérons à présent un modèle de régression avec une variable réponse Y
et un prédicteur qualitatif représenté par ces m = q − 1 prédicteurs binaires.
L’équation de notre hyperplan de régression est donc la suivante :
y
∗ =
β 0 +
β 1 x 1 +
β 2 x 2 + · · · +
β q−1 x q−1 .
4 Notons que, selon les logiciels statistiques, ce sera parfois le premier groupe (et non le
dernier groupe comme nous le faisons ici) qui sera le groupe de référence, c’est-à-dire le groupe
pour lequel chacune des q − 1 variables binaires seront nulles.
