194
Statistique appliquée aux sciences de la vie
variance(Y ) = variance(β 0 + β 1 X) + variance(ε).
On peut ainsi décomposer la variance de Y en une somme de deux variances, la
variance du meilleur prédicteur linéaire et la variance résiduelle. Autrement dit,
on peut décomposer la variance (la variabilité) de Y en une partie prédictible
et une partie non prédictible :
• variance(β 0 + β 1 X), c’est-à-dire la variance de Y prédite linéairement
par X, représente la variabilité prédictible
• variance(ε), c’est-à-dire la variance résiduelle, représente la variabilité
non prédictible.
À ce stade, on mentionnera le résultat remarquable suivant, que nous avions
déjà évoqué dans le chapitre précédent :
ρ
2
= β
2
1 ·
variance(X)
variance(Y )
=
variance(β 0 + β 1 X)
variance(Y )
= 1 −
variance(ε)
variance(Y )
.
Autrement dit :
• le carré ρ
2 de la corrélation entre X et Y représente le pourcentage de la
variance de Y prédite linéairement par X
• la quantité 1 − ρ
2 représente le pourcentage de la variance de Y qui n’est
pas prédite linéairement par X.
Ainsi, le carré de la corrélation est une mesure de la qualité globale des prédictions que l’on fera en utilisant la droite de régression
4 . On notera les deux cas
extrêmes suivants :
• ρ
2 = 1 : on prédit 100 % de la variance de Y linéairement par X (on a
une relation exacte linéaire entre X et Y )
• ρ
2 = 0 : on prédit 0 % de la variance de Y linéairement par X (la
connaissance de X ne nous sert en rien pour prédire Y , du moins si on
utilise la droite de régression).
4 Bien que la droite de régression ne soit en général pas la même pour prédire Y à partir
de X ou pour prédire X à partir de Y , la qualité de la prédiction sera la même dans les deux
cas, ρ 2 représentant à la fois le pourcentage de la variance de Y prédite linéairement par X
et le pourcentage de la variance de X prédite linéairement par Y .
Statistique appliquée aux sciences de la vie
variance(Y ) = variance(β 0 + β 1 X) + variance(ε).
On peut ainsi décomposer la variance de Y en une somme de deux variances, la
variance du meilleur prédicteur linéaire et la variance résiduelle. Autrement dit,
on peut décomposer la variance (la variabilité) de Y en une partie prédictible
et une partie non prédictible :
• variance(β 0 + β 1 X), c’est-à-dire la variance de Y prédite linéairement
par X, représente la variabilité prédictible
• variance(ε), c’est-à-dire la variance résiduelle, représente la variabilité
non prédictible.
À ce stade, on mentionnera le résultat remarquable suivant, que nous avions
déjà évoqué dans le chapitre précédent :
ρ
2
= β
2
1 ·
variance(X)
variance(Y )
=
variance(β 0 + β 1 X)
variance(Y )
= 1 −
variance(ε)
variance(Y )
.
Autrement dit :
• le carré ρ
2 de la corrélation entre X et Y représente le pourcentage de la
variance de Y prédite linéairement par X
• la quantité 1 − ρ
2 représente le pourcentage de la variance de Y qui n’est
pas prédite linéairement par X.
Ainsi, le carré de la corrélation est une mesure de la qualité globale des prédictions que l’on fera en utilisant la droite de régression
4 . On notera les deux cas
extrêmes suivants :
• ρ
2 = 1 : on prédit 100 % de la variance de Y linéairement par X (on a
une relation exacte linéaire entre X et Y )
• ρ
2 = 0 : on prédit 0 % de la variance de Y linéairement par X (la
connaissance de X ne nous sert en rien pour prédire Y , du moins si on
utilise la droite de régression).
4 Bien que la droite de régression ne soit en général pas la même pour prédire Y à partir
de X ou pour prédire X à partir de Y , la qualité de la prédiction sera la même dans les deux
cas, ρ 2 représentant à la fois le pourcentage de la variance de Y prédite linéairement par X
et le pourcentage de la variance de X prédite linéairement par Y .
