206
Statistique appliquée aux sciences de la vie
On ajoute alors une quatrième hypothèse à ce modèle de régression qui
consiste à supposer que ces n résidus sont indépendants les uns des autres
9 . Les
quatre hypothèses d’un modèle de régression linéaire simple, que l’on retrouvera
en régression multiple, sont donc :
linéarité
: mean(ε i ) = 0
homoscédasticité
: variance(ε i ) = σ
2
ε
normalité
: ε i normalement distribués
indépendance
: ε i indépendants.
13.7 Inférence sur la droite de régression
Nous allons à présent voir comment faire de l’inférence sur la droite de régression
10 . Sous les hypothèses d’un modèle de régression linéaire simple (discutées en détail dans la section précédente), on peut montrer que
β 0 et
β 1 sont
9 Dans certains ouvrages, cette quatrième hypothèse vient en troisième position, la normalité venant en quatrième. Nous l’avons mis en quatrième car contrairement aux trois
premières hypothèses, qui concernent la nature du phénomène étudié, cette quatrième hypothèse concerne l’échantillonnage. Notons que ce ne sont pas les observations Y i de la variable
Y qui doivent être indépendantes, mais bel et bien les erreurs de prédiction ε i . Pour rendre
clair cette distinction, notons qu’en régression (contrairement à ce que l’on a vu en corrélation) on pourra choisir les valeurs x i de la variable X comme il nous plaira (on pourra
par exemple sur-représenter les grands et sous-représenter les petits, si cela nous chante).
Ainsi, si on décide que nos deux premiers individus (sur les n de notre échantillon) doivent
mesurer x 1 = x 2 = 170 cm, il s’agira pour ces deux premières observations de tirer au hasard
deux individus parmi la population des individus mesurant 170 cm. Leurs poids Y 1 et Y 2
ne seront certes pas indépendants. En effet, la connaissance du poids du premier individu
nous informera sur le poids du second (du moins s’il y a une certaine association entre les
variables X et Y , de sorte que les poids de deux individus de même taille auront tendance à
se ressembler). Par contre, leurs résidus ε 1 = y 1 − β 0 − β 1 x 1 et ε 2 = y 2 − β 0 − β 1 x 2 seront
indépendants. En effet, la connaissance du résidu du premier individu ne nous informera en
rien sur le résidu du second : savoir par exemple que le poids du premier individu se trouve
au-dessus de la moyenne de son groupe ne nous donnera aucune indication sur la position du
poids du second individu par rapport à la moyenne de son groupe.
10 Rappelons ici le paradigme de la statistique, qui consiste à considérer un estimateur
comme étant une variable en s’imaginant que l’on répète l’échantillonnage. Lorsque les données sont bivariées, il s’agit de préciser comment on s’imagine cette répétition de l’échantillonnage. Il y a au moins deux approches possibles :
• on peut s’imaginer avoir dans chaque échantillon n réalisations indépendantes (X i , Y i )
de la variable bivariée (X, Y )
→ les X i et les Y i seront différents dans chaque échantillon
• on peut s’imaginer avoir n réalisations indépendantes Y i des variables « conditionnelles »
Précédent

- 215/327

Suivant