13. Régression linéaire simple
209
qui nous permet de calculer ˜
σ
2
ε à partir des moyennes habituelles (on n’a pas
besoin du détail des données, mais seulement de connaître
1
n
i x i ,
1
n
i y i ,
1
n
i x
2
i ,
1
n
i x i y i et
1
n
i y
2
i ).
Afin de faire de l’inférence sur les paramètres β 0 , β 1 et β 0 + β 1 x en utilisant
la méthode de Wald, on remplacera la variance résiduelle σ
2
ε par son estimateur
˜
σ
2
ε dans les formules des variances des estimateurs
β 0 ,
β 1 et
β 0 +
β 1 x données
ci-dessus. Ici aussi, cependant, ce remplacement ne sera pas totalement anodin
et nous amènera à utiliser des quantiles d’une distribution de Student (avec
n − 2 dl) plutôt que des quantiles d’une distribution normale standardisée dans
le calcul des intervalles de confiance pour ces paramètres, ou pour les tests
statistiques correspondants (voir ci-dessous). Toujours sous les hypothèses de
notre modèle, ces intervalles de confiance et ces tests statistiques seront exacts,
y compris pour de petits échantillons à partir de n ≥ 3.
Sous les hypothèses du modèle, on pourra donc calculer les intervalles de
confiance de Student suivants pour les paramètres d’une régression
12 :
• intervalle de confiance au niveau 1 − α pour β 0 :
β 0 ± t 1−α/2,n−2 ·
˜
σ 2
ε
n
·
i x 2
i
i (x i − ¯
x) 2
• intervalle de confiance au niveau 1 − α pour β 1 :
β 1 ± t 1−α/2,n−2 ·
˜
σ 2
ε
i (x i − ¯
x) 2
• intervalle de confiance au niveau 1 − α pour β 0 + β 1 x :
β 0 +
β 1 x ± t 1−α/2,n−2 ·
˜
σ 2
ε
1
n
+
(x − ¯
x) 2
i (x i − ¯
x) 2
.
Le troisième de ces intervalles de confiance peut se calculer pour chaque valeur
possible x. La figure 13.7 nous montre ces intervalles calculés avec les données
de notre exemple. On y voit la borne inférieure et la borne supérieure d’un
intervalle de confiance au niveau 95 % pour β 0 + β 1 x en fonction de x. On voit
12 Si les hypothèses du modèle ne sont pas satisfaites, la validité de l’inférence n’est pas
garantie. On peut examiner à l’aide de simulations quelles sont les conséquences des violations de ces hypothèses sur la validité de l’inférence. Certains commentaires faits dans les
chapitres précédents restent ici valables, par exemple le fait que l’on perde de la puissance
statistique lorsque l’on s’éloigne de la normalité, notamment en présence de valeurs extrêmes
ou aberrantes pour les ε i . Une violation de l’hypothèse d’homoscédasticité risque d’être plus
problématique, surtout si les ε i avec une forte variabilité sont moins représentés dans notre
échantillon que les ε i avec une faible variabilité (de la même manière, on a vu qu’un test de
Student pour une différence de moyenne sera libéral si c’est le petit groupe qui varie le plus).
L’hypothèse d’indépendance est indispensable (sans quoi l’inférence pourrait être libérale,
même en cas d’une légère violation) alors qu’une violation grave de l’hypothèse de linéarité
rendra la droite de régression moins intéressante (et l’inférence moins indispensable).
Précédent

- 218/327

Suivant