190
Statistique appliquée aux sciences de la vie
Le résolution de ce système d’équations à deux inconnues nous donne les solutions :
β 1 =
1
n
i x i y i − ¯
x¯ y
1
n
i x 2
i − ¯
x 2
et
β 0 = ¯
y −
β 1 ¯
x.
Afin de calculer la droite de régression, il suffit donc de connaître les moyennes
suivantes : ¯
x =
1
n
i x i , ¯
y =
1
n
i y i ,
1
n
i x
2
i et
1
n
i x i y i . Ainsi, la pente
de la droite de régression est égale à la covariance entre X et Y divisée par la
variance de X. Notons aussi le lien suivant entre le coefficient de corrélation et
la pente de la droite de régression
2 :
ρ =
β 1 ·
˜
σ X
˜
σ Y
.
Comme le quotient ˜
σ X /˜ σ Y des estimateurs des écarts types de X et de Y est
un nombre positif, le signe de la pente de la droite de régression est le même
que le signe de la corrélation. Ainsi :
• la relation entre X et Y est globalement positive si
β 1 > 0
• la relation entre X et Y est globalement négative si
β 1 < 0
• la relation entre X et Y est globalement nulle si
β 1 = 0.
La droite de régression possède de nombreuses propriétés mathématiques.
En voici quelques-unes :
• la droite de régression passe par le centre de gravité des données (¯ x, ¯
y)
• la somme (et donc la moyenne) des résidus est nulle
→ on aura en effet :
i
ε i =
i
(y i −
β 0 −
β 1 x i )
=
i
(y i − (¯ y −
β 1 ¯
x) −
β 1 x i )
=
i
(y i − ¯
y) −
β 1
i
(x i − ¯
x)
= 0
2 On peut ici utiliser indifféremment les estimateurs des variances avec dénominateur n
ou n − 1, et donc remplacer le quotient ˜
σ X /˜ σ Y par le quotient b
σ X /b σ Y . De même, on peut
utiliser indifféremment un dénominateur n ou n − 1 pour la covariance et la variance utilisées
lors du calcul de b
β 1 car on a :
b
β 1 =
1
n
P
i (x i − ¯
x)(y i − ¯
y)
1
n
P
i (x i − ¯
x) 2
=
1
n−1
P
i (x i − ¯
x)(y i − ¯
y)
1
n−1
P
i (x i − ¯
x) 2
.
Précédent

- 199/327

Suivant