13. Régression linéaire simple
213
s’il existe une association statistique entre X et Y , on pourra alors ajuster cet
intervalle de prédiction en utilisant notre modèle de régression. Sous les hypothèses du modèle, la variable Y |X = x sera en effet normale avec une moyenne
β 0 + β 1 x, estimée par
β 0 +
β 1 x, et avec une variance σ
2
ε , estimée par ˜
σ
2
ε . On
calculera ainsi l’intervalle de prédiction ajusté suivant :
β 0 +
β 1 x ± 2 · ˜
σ ε .
Si les hypothèses du modèle sont correctes, cet intervalle contiendra la valeur
Y de cet individu avec une probabilité (approximativement) de 0.95.
On peut ainsi calculer deux intervalles de prédiction pour la valeur Y de
cet individu. En principe, le second intervalle sera cependant plus court que le
premier et en ce sens la prédiction sera plus précise. La longueur du premier
intervalle sera égale (approximativement) à 4σ Y , alors que la longueur du second sera égale (approximativement) à 4σ ε . On peut quantifier cette réduction
de longueur obtenue en utilisant le second intervalle de prédiction plutôt que le
premier en l’exprimant en pourcentage de la longueur du premier comme suit
(que nous noterons ici P IR pour prediction interval reduction) :
P IR =
4σ Y − 4σ ε
4σ Y
= 1 −
σ ε
σ Y
.
Cette formule n’est pas sans rappeler celle du carré de la corrélation :
ρ
2 = 1 −
σ
2
ε
σ 2
Y
.
On peut calculer ainsi :
P IR = 1 −
1 − ρ 2 .
On a vu que le carré de la corrélation est une mesure de l’intensité de l’association entre X et Y que l’on peut interpréter comme le pourcentage de la
variance de Y prédite linéairement par X. Cette quantité P IR représente une
mesure alternative de l’intensité de cette association que l’on peut interpréter
comme la réduction de longueur de l’intervalle de prédiction lorsque l’on utilise
X pour prédire Y , comparé à une situation sans prédicteur.
Par exemple, une corrélation de ρ = 0.5 correspond à un pourcentage de
variance prédite de 25 % et à une réduction de longueur de l’intervalle de
prédiction de seulement P IR = 1−
√
1 − 0.5 2 = 13 %. En ce sens, un prédicteur
dont la corrélation avec la variable réponse est de 0.5 ne nous sera pas d’une
immense utilité pour améliorer nos prédictions. Afin d’obtenir une réduction de
P IR = 50 % (c’est-à-dire de diminuer par deux la longueur de nos intervalles de
prédiction), il s’agira d’avoir à disposition un prédicteur X dont la corrélation
avec Y est au moins de ρ = ±0.87, ce qui n’est pas si courant. Pour atteindre
P IR = 75 %, la corrélation doit être de ρ = ±0.97, ce qui est encore moins
courant. Cela illustre toute la difficulté d’obtenir des prédictions précises en
pratique. On essaiera d’améliorer un peu la situation au chapitre suivant avec
la régression multiple, mais la tâche restera difficile.
213
s’il existe une association statistique entre X et Y , on pourra alors ajuster cet
intervalle de prédiction en utilisant notre modèle de régression. Sous les hypothèses du modèle, la variable Y |X = x sera en effet normale avec une moyenne
β 0 + β 1 x, estimée par
β 0 +
β 1 x, et avec une variance σ
2
ε , estimée par ˜
σ
2
ε . On
calculera ainsi l’intervalle de prédiction ajusté suivant :
β 0 +
β 1 x ± 2 · ˜
σ ε .
Si les hypothèses du modèle sont correctes, cet intervalle contiendra la valeur
Y de cet individu avec une probabilité (approximativement) de 0.95.
On peut ainsi calculer deux intervalles de prédiction pour la valeur Y de
cet individu. En principe, le second intervalle sera cependant plus court que le
premier et en ce sens la prédiction sera plus précise. La longueur du premier
intervalle sera égale (approximativement) à 4σ Y , alors que la longueur du second sera égale (approximativement) à 4σ ε . On peut quantifier cette réduction
de longueur obtenue en utilisant le second intervalle de prédiction plutôt que le
premier en l’exprimant en pourcentage de la longueur du premier comme suit
(que nous noterons ici P IR pour prediction interval reduction) :
P IR =
4σ Y − 4σ ε
4σ Y
= 1 −
σ ε
σ Y
.
Cette formule n’est pas sans rappeler celle du carré de la corrélation :
ρ
2 = 1 −
σ
2
ε
σ 2
Y
.
On peut calculer ainsi :
P IR = 1 −
1 − ρ 2 .
On a vu que le carré de la corrélation est une mesure de l’intensité de l’association entre X et Y que l’on peut interpréter comme le pourcentage de la
variance de Y prédite linéairement par X. Cette quantité P IR représente une
mesure alternative de l’intensité de cette association que l’on peut interpréter
comme la réduction de longueur de l’intervalle de prédiction lorsque l’on utilise
X pour prédire Y , comparé à une situation sans prédicteur.
Par exemple, une corrélation de ρ = 0.5 correspond à un pourcentage de
variance prédite de 25 % et à une réduction de longueur de l’intervalle de
prédiction de seulement P IR = 1−
√
1 − 0.5 2 = 13 %. En ce sens, un prédicteur
dont la corrélation avec la variable réponse est de 0.5 ne nous sera pas d’une
immense utilité pour améliorer nos prédictions. Afin d’obtenir une réduction de
P IR = 50 % (c’est-à-dire de diminuer par deux la longueur de nos intervalles de
prédiction), il s’agira d’avoir à disposition un prédicteur X dont la corrélation
avec Y est au moins de ρ = ±0.87, ce qui n’est pas si courant. Pour atteindre
P IR = 75 %, la corrélation doit être de ρ = ±0.97, ce qui est encore moins
courant. Cela illustre toute la difficulté d’obtenir des prédictions précises en
pratique. On essaiera d’améliorer un peu la situation au chapitre suivant avec
la régression multiple, mais la tâche restera difficile.
