224
Statistique appliquée aux sciences de la vie
L’hypothèse de linéarité consiste à supposer que les moyennes de la variable
Y définies dans chacun de ces innombrables groupes sont « hyper-alignées »,
autrement dit qu’elles se trouvent sur l’hyperplan de régression.
L’hypothèse de linéarité est ainsi la suivante :
mean(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) = β 0 + β 1 x 1 + β 2 x 2 + · · · β m x m
où mean(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) désigne la moyenne de Y dans
le groupe défini par X 1 = x 1 , X 2 = x 2 , · · · , X m = x m . Ainsi, utiliser l’hyperplan de régression pour faire de la prédiction consiste à prédire la valeur de Y
d’un individu par la moyenne du groupe auquel cet individu appartient, l’erreur
de prédiction étant la différence entre la valeur de Y pour cet individu et la
moyenne de son groupe. Cette dernière peut être interprétée comme la valeur
de Y ajustée pour les caractéristiques de l’individu par rapport aux prédicteurs. De même pour les individus de notre échantillon, la valeur prédite
y
∗
i est
une estimation de mean(Y |X 1 = x i1 , X 2 = x i2 , · · · , X m = x im ), c’est-à-dire
de la moyenne du groupe auquel le i-ième individu appartient, et
ε i est une
estimation de la différence entre la valeur y i de cet individu et cette moyenne.
L’hypothèse de linéarité est donc encore plus forte en régression multiple
qu’en régression simple, impliquant davantage de groupes. Ici aussi, l’hypothèse
de linéarité revient à dire que les erreurs de prédictions sont en moyenne nulles
non seulement globalement mais également localement (dans chaque groupe).
On aura donc non seulement mean(ε) = 0, mais également :
mean(ε|X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) = 0
quel que soit le groupe défini par X 1 = x 1 , X 2 = x 2 , · · · , X m = x m . Cette
condition ne sera cependant pas facile à vérifier dans un espace à m + 1 dimensions. En plus d’un problème de visualisation, les données seront relativement
éloignées les unes des autres dans un tel espace, de sorte qu’il ne sera pas commode de regrouper les individus localement, comme on l’avait fait en régression
simple. Les dangers de l’extrapolation nous guetteront ainsi d’autant plus en
régression multiple qu’en régression simple car nos prédictions se feront souvent
en dehors du domaine d’observation. On voudra par exemple utiliser notre hyperplan de régression pour prédire la graisse corporelle d’un individu pesant 80
kg, âgés de 40 ans, mesurant 175 cm, avec un abdomen de 115 cm, un biceps de
30 cm et un poignet de 19 cm, comme on l’a fait dans notre exemple ci-dessus,
mais un tel individu se trouvera peut-être éloigné de chacun des n individus de
notre échantillon, de sorte que l’on n’aura aucune garantie de la qualité de la
prédiction dans cet endroit de l’espace défini par les m prédicteurs.
14.3 Interprétation des paramètres
Sous l’hypothèse de linéarité, on peut en outre interpréter les paramètres
β 0 , β 1 , · · · , β m de l’hyperplan de régression comme suit :
Statistique appliquée aux sciences de la vie
L’hypothèse de linéarité consiste à supposer que les moyennes de la variable
Y définies dans chacun de ces innombrables groupes sont « hyper-alignées »,
autrement dit qu’elles se trouvent sur l’hyperplan de régression.
L’hypothèse de linéarité est ainsi la suivante :
mean(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) = β 0 + β 1 x 1 + β 2 x 2 + · · · β m x m
où mean(Y |X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) désigne la moyenne de Y dans
le groupe défini par X 1 = x 1 , X 2 = x 2 , · · · , X m = x m . Ainsi, utiliser l’hyperplan de régression pour faire de la prédiction consiste à prédire la valeur de Y
d’un individu par la moyenne du groupe auquel cet individu appartient, l’erreur
de prédiction étant la différence entre la valeur de Y pour cet individu et la
moyenne de son groupe. Cette dernière peut être interprétée comme la valeur
de Y ajustée pour les caractéristiques de l’individu par rapport aux prédicteurs. De même pour les individus de notre échantillon, la valeur prédite
y
∗
i est
une estimation de mean(Y |X 1 = x i1 , X 2 = x i2 , · · · , X m = x im ), c’est-à-dire
de la moyenne du groupe auquel le i-ième individu appartient, et
ε i est une
estimation de la différence entre la valeur y i de cet individu et cette moyenne.
L’hypothèse de linéarité est donc encore plus forte en régression multiple
qu’en régression simple, impliquant davantage de groupes. Ici aussi, l’hypothèse
de linéarité revient à dire que les erreurs de prédictions sont en moyenne nulles
non seulement globalement mais également localement (dans chaque groupe).
On aura donc non seulement mean(ε) = 0, mais également :
mean(ε|X 1 = x 1 , X 2 = x 2 , · · · , X m = x m ) = 0
quel que soit le groupe défini par X 1 = x 1 , X 2 = x 2 , · · · , X m = x m . Cette
condition ne sera cependant pas facile à vérifier dans un espace à m + 1 dimensions. En plus d’un problème de visualisation, les données seront relativement
éloignées les unes des autres dans un tel espace, de sorte qu’il ne sera pas commode de regrouper les individus localement, comme on l’avait fait en régression
simple. Les dangers de l’extrapolation nous guetteront ainsi d’autant plus en
régression multiple qu’en régression simple car nos prédictions se feront souvent
en dehors du domaine d’observation. On voudra par exemple utiliser notre hyperplan de régression pour prédire la graisse corporelle d’un individu pesant 80
kg, âgés de 40 ans, mesurant 175 cm, avec un abdomen de 115 cm, un biceps de
30 cm et un poignet de 19 cm, comme on l’a fait dans notre exemple ci-dessus,
mais un tel individu se trouvera peut-être éloigné de chacun des n individus de
notre échantillon, de sorte que l’on n’aura aucune garantie de la qualité de la
prédiction dans cet endroit de l’espace défini par les m prédicteurs.
14.3 Interprétation des paramètres
Sous l’hypothèse de linéarité, on peut en outre interpréter les paramètres
β 0 , β 1 , · · · , β m de l’hyperplan de régression comme suit :
