234
Statistique appliquée aux sciences de la vie
de régression multiple se formulent exactement de la même manière que les
quatre hypothèses d’un modèle de régression simple, à savoir :
linéarité
: mean(ε i ) = 0
homoscédasticité
: variance(ε i ) = σ
2
ε
normalité
: ε i normalement distribués
indépendance
: ε i indépendants.
14.7 Analyse des résidus
Les hypothèses d’un modèle de régression linéaire peuvent donc être formulées en fonction des résidus ε i . Afin de vérifier ces hypothèses, on utilisera nos
résidus estimés
ε i et on procédera à une analyse des résidus. Il sera cependant
impossible de vérifier ces hypothèses pour toutes les combinaisons des valeurs
possibles de X 1 , X 2 , · · · , X m . On effectuera alors des regroupements. On regardera par exemple si les hypothèses du modèle sont (approximativement)
satisfaites aux alentours des observations avec X 1 = x 1 (on regroupera toutes
les observations avec une valeur proche de X 1 = x 1 , quelles que soient leurs
valeurs pour les autres prédicteurs X 2 , · · · , X m )
10 . Ceci peut se faire à l’aide
d’un diagramme de dispersion montrant les résidus estimés
ε i en fonction du
prédicteur X 1 . On procédera ensuite de la même manière pour les autres prédicteurs X 2 , · · · , X m , obtenant m diagrammes de dispersion. Les hypothèses
du modèle ne sont pas contredites si dans aucun de ces graphiques n’apparaît
un signe de non-linéarité, de non-homoscédasticité ou de non-normalité
11 .
trois autres hypothèses concernent la nature du phénomène étudié. Ici aussi, ce ne sont pas les
observations Y i de la variable Y qui doivent être indépendantes, mais les erreurs de prédiction
ε i . Ceci implique que l’on pourra (si on le désire) choisir les valeurs x i1 , x i2 , · · · , x im des
différents individus de notre échantillon, c’est-à-dire que l’on pourra choisir les groupes qui
sont représentés dans notre échantillon, pour autant que les individus soient alors tirés au
hasard (et indépendamment les uns des autres) de ces différents groupes.
10 La distribution des résidus étant la même, c’est-à-dire normale de moyenne nulle et
de variance σ 2
ε , dans chacun des innombrables groupes définis par toutes les combinaisons
de valeurs possibles de X 1 , X 2 , · · · , Xm, elle sera encore normale de moyenne nulle et de
variance σ 2
ε lorsque l’on mettra ensemble les résidus de certains de ces groupes, par exemple
tous ceux avec X 1 = x 1 . De même, la distribution sera toujours normale de moyenne nulle
et de variance σ 2
ε lorsque l’on regroupera l’ensemble des résidus de notre échantillon (mettre
ensemble des observations avec une même distribution ne modifiera pas la distribution).
11 L’hypothèse d’indépendance (qui concerne l’échantillonnage) sera en principe plus difficile
à vérifier empiriquement, sauf dans des cas particuliers. Par exemple, lorsque les observations
sont récoltées au cours du temps, on pourra utiliser des méthodes du domaine des séries
chronologiques afin de vérifier que les résidus de deux observations récoltées proches dans le
Précédent

- 242/327

Suivant