13. Régression linéaire simple
215
La figure 13.8 nous montre les intervalles de prédiction pour le poids Y d’un
individu avec une taille X = x calculés dans le cadre de notre exemple cidessus pour différentes valeurs possibles de x. On constate que ces intervalles
sont évidemment beaucoup plus larges que les intervalles de confiance pour les
moyennes β 0 + β 1 x des poids des individus avec X = x que l’on avait montrés
dans la figure 13.7. On constate également que ces intervalles contiennent 29
des 30 observations, ce qui représente effectivement approximativement 95 %
des observations
14 .
13.9 Régression vers la moyenne
On considère dans cette section un modèle de régression linéaire dans le cas
particulier où X et Y ont une même distribution, que l’on supposera normale
avec une moyenne μ et une variance σ
2 , et où la corrélation entre X et Y est
positive. Comme les deux variables ont même variance, la pente de la droite de
régression coïncide avec la corrélation :
β 1 = ρ.
Ainsi, la pente de la droite de régression ne peut pas être dans ce cas plus
grande que 1. On aura par ailleurs :
β 0 = (1 − ρ)μ.
Si on suppose en plus que (X, Y ) est normale bivariée, l’hypothèse de linéarité
sera satisfaite et on aura ainsi :
mean(Y |X = x) = β 0 + β 1 x = (1 − ρ)μ + ρx.
La moyenne de la variable Y pour le groupe X = x sera donc quelque part entre
μ et x (elle sera plus proche de μ si ρ < 0.5, et plus proche de x si ρ > 0.5). Si
0 < ρ < 1, on a alors les résultats suivants :
• x > μ implique mean(Y |X = x) < x
• x < μ implique mean(Y |X = x) > x.
14 En fait, les intervalles de prédiction dans cette figure ont été calculés non pas avec la
formule approximative donnée ci-dessus, mais avec la formule exacte donnée par :
b
β 0 + b
β 1 x ± t 0.975,n−2 · ˜
σε
s
1 +
1
n
+
(x − ¯
x) 2
P
i (x i − ¯
x) 2
qui tient compte de l’incertitude due au fait que les moyennes et les variances ont été estimées
(elles ne sont pas connues). De tels intervalles de prédiction deviennent un petit peu plus
larges lorsque la valeur x s’éloigne du centre ¯
x des données, ceci moins nettement toutefois
que pour les intervalles de confiance pour les moyennes β 0 + β 1 x. Nous reviendrons sur le
concept d’intervalle de prédiction exact dans le chapitre suivant.
Précédent

- 224/327

Suivant