15. Régression avec prédicteurs binaires
271
Notons que l’hypothèse de linéarité est ici forcément satisfaite, de sorte que l’on
prédit la valeur Y d’un individu par la moyenne du groupe auquel cet individu
appartient
5 . On interprète par ailleurs les paramètres de la façon suivante :
• β0 = mean(Y |X1 = · · · = Xq−1 = 0)
→ la constante est la moyenne de Y dans le groupe (de référence) q
• β1 = mean(Y |X1 = 1, X2 = · · · = Xq−1 = 0) − mean(Y |X1 = · · · = Xq−1 = 0)
→ la pente associée à X 1 est la différence de moyenne de Y entre les
groupes 1 et q
• β2 = mean(Y |X2 = 1, X1 = · · · = Xq−1 = 0) − mean(Y |X1 = · · · = Xq−1 = 0)
→ la pente associée à X 2 est la différence de moyenne de Y entre les
groupes 2 et q
→ interprétation similaire pour toutes les pentes.
L’hypothèse nulle d’aucune association entre cette variable qualitative avec
q valeurs possibles et la variable réponse Y revient à dire que la moyenne de Y
est la même dans les q groupes, autrement dit que :
H 0 : β 1 = β 2 = · · · = β q−1 = 0.
Cette hypothèse nulle peut se tester avec un test F sur la nullité simultanée de
l’ensemble de ces m = q − 1 pentes. Si l’hypothèse nulle ci-dessus est rejetée,
on conclut que les q groupes n’ont pas tous la même moyenne de Y . Afin
de savoir quels sont les groupes qui diffèrent significativement des autres, on
pourra effectuer des tests dits post hoc, en comparant deux à deux les différents
groupes
6 . Différentes méthodes existent pour traiter de la problématique des
tests multiples, l’une d’elles étant la correction de Bonferroni introduite au
chapitre 6.
Exemple 15.4 On a introduit au chapitre 5 deux échantillons d’Onobrychis
cultivés avec un niveau nutritif faible et avec un niveau nutritif élevé. En fait,
parmi les 60 Onobrychis cultivés avec un niveau nutritif faible, les 30 premiers
ont été cultivés avec le niveau nutritif 1 et les 30 suivants avec le niveau nutritif
5 En effet, seules q parmi les 2 q−1 combinaisons théoriques des valeurs possibles de ces q −1
prédicteurs définissent un groupe qui a du sens (une combinaison avec X 1 = X 2 = 1 n’aurait
par exemple pas de sens). L’hypothèse de linéarité est donc satisfaite car un hyperplan de
régression défini par q paramètres passe forcément par les moyennes de ces q groupes. Un
modèle de régression linéaire est donc ici constitué uniquement de trois hypothèses, à savoir
que la variance est la même dans chaque groupe, que la distribution est normale dans chaque
groupe et que les observations sont indépendantes.
6 On pourra comparer les groupes 1 et q, les groupes 2 et q, · · · , ou les groupes q − 1 et
q en effectuant des tests de Student sur la nullité des pentes β 1 , β 2 , · · · , ou β q−1 du modèle
ci-dessus. Afin d’effectuer des comparaisons impliquant d’autres groupes que le groupe de
référence q, par exemple une comparaison entre les groupes 1 et 2, on pourra recalculer la
régression en codant les groupes différemment (en changeant ainsi le groupe de référence).
Précédent

- 279/327

Suivant