242
Statistique appliquée aux sciences de la vie
on obtient p = 0.219, de sorte que l’on ne rejette pas l’hypothèse de la nullité
de la pente du poids au seuil de 5 %. Par ailleurs, un intervalle de confiance au
niveau 95 % pour la véritable pente du poids s’obtient comme suit (en utilisant
t 0.975,241 = 1.97) :
0.012 ± 1.97 · 0.097 = [−0.179; 0.203].
Notons qu’afin de calculer ces erreurs types, il aura fallu auparavant calculer
une estimation de la variance résiduelle, donnée ici par ˜
σ
2
ε = 18.2.
14.9 Estimation du pourcentage de la variance
prédite
Nous allons voir à présent comment estimer le pourcentage ρ
2 de la variance de Y prédite par l’ensemble des m prédicteurs d’un modèle de régression linéaire. Notons tout d’abord que la décomposition de la variance de Y
en une somme de deux termes, représentant la variance prédite et la variance
résiduelle, est non seulement valable dans la population, mais également dans
l’échantillon (pour autant que l’on utilise la définition originale de la variance
avec un dénominateur n). On a en effet :
(y i − ¯
y)
2
n
=
i ( y
∗
i − ¯
y)
2
n
+
i (y i −
y
∗
i )
2
n
.
L’estimateur empirique de ρ
2 est donc le suivant
18 :
ρ
2 =
i ( y
∗
i − ¯
y)
2
(y i − ¯
y) 2 .
Pour un grand nombre m de prédicteurs, ce ne sera pourtant pas un bon estimateur de ρ
2 . Rappelons que l’on a par définition :
ρ
2 = 1 −
σ
2
ε
σ 2
Y
.
Par ailleurs, l’estimateur
ρ
2 peut s’écrire par :
ρ
2 = 1 −
i (y i −
y
∗
i )
2
(y i − ¯
y) 2 = 1 −
σ
2
ε
σ 2
Y
.
Dans cette dernière formulation, on utilise
σ
2
ε =
ε
2
i /n et
σ
2
Y =
(y i − ¯
y)
2 /n,
qui sont des estimateurs biaisés, sous-estimant σ
2
ε et σ
2
Y . Comme le biais du
18 Rappelons qu’en régression simple, l’estimateur b
ρ 2 ainsi défini est égal au carré de la
corrélation empirique entre l’unique prédicteur et la variable réponse. Plus généralement, b
ρ 2
sera le carré de la corrélation empirique entre les valeurs observées y i et les valeurs prédites
b
y ∗
i , ce résultat étant valable en régression simple comme en régression multiple.
Statistique appliquée aux sciences de la vie
on obtient p = 0.219, de sorte que l’on ne rejette pas l’hypothèse de la nullité
de la pente du poids au seuil de 5 %. Par ailleurs, un intervalle de confiance au
niveau 95 % pour la véritable pente du poids s’obtient comme suit (en utilisant
t 0.975,241 = 1.97) :
0.012 ± 1.97 · 0.097 = [−0.179; 0.203].
Notons qu’afin de calculer ces erreurs types, il aura fallu auparavant calculer
une estimation de la variance résiduelle, donnée ici par ˜
σ
2
ε = 18.2.
14.9 Estimation du pourcentage de la variance
prédite
Nous allons voir à présent comment estimer le pourcentage ρ
2 de la variance de Y prédite par l’ensemble des m prédicteurs d’un modèle de régression linéaire. Notons tout d’abord que la décomposition de la variance de Y
en une somme de deux termes, représentant la variance prédite et la variance
résiduelle, est non seulement valable dans la population, mais également dans
l’échantillon (pour autant que l’on utilise la définition originale de la variance
avec un dénominateur n). On a en effet :
(y i − ¯
y)
2
n
=
i ( y
∗
i − ¯
y)
2
n
+
i (y i −
y
∗
i )
2
n
.
L’estimateur empirique de ρ
2 est donc le suivant
18 :
ρ
2 =
i ( y
∗
i − ¯
y)
2
(y i − ¯
y) 2 .
Pour un grand nombre m de prédicteurs, ce ne sera pourtant pas un bon estimateur de ρ
2 . Rappelons que l’on a par définition :
ρ
2 = 1 −
σ
2
ε
σ 2
Y
.
Par ailleurs, l’estimateur
ρ
2 peut s’écrire par :
ρ
2 = 1 −
i (y i −
y
∗
i )
2
(y i − ¯
y) 2 = 1 −
σ
2
ε
σ 2
Y
.
Dans cette dernière formulation, on utilise
σ
2
ε =
ε
2
i /n et
σ
2
Y =
(y i − ¯
y)
2 /n,
qui sont des estimateurs biaisés, sous-estimant σ
2
ε et σ
2
Y . Comme le biais du
18 Rappelons qu’en régression simple, l’estimateur b
ρ 2 ainsi défini est égal au carré de la
corrélation empirique entre l’unique prédicteur et la variable réponse. Plus généralement, b
ρ 2
sera le carré de la corrélation empirique entre les valeurs observées y i et les valeurs prédites
b
y ∗
i , ce résultat étant valable en régression simple comme en régression multiple.
