2. Distribution d’une variable
33
on essaiera de transformer la variable afin de la rendre approximativement
normale. Si on hésite entre deux transformations, on choisira la transformation
pour laquelle ces deux mesures de non-normalité sont les plus proches de zéro
14 .
Exemple 2.10 Pour la hauteur Y des Onobrychis, on calcule skewness(Y ) =
0.49 et kurtosis(Y ) = −0.15, nous suggérant une fois encore une normalité
approximative.
2.12 Transformation logarithmique
Nous venons de rappeler qu’il est parfois souhaitable de transformer les
données dans le but de nous approcher de la normalité afin de faciliter l’analyse statistique. Une transformation qui fonctionne souvent en pratique lorsque
la distribution est asymétrique vers la droite, et qui offre certains avantages
d’interprétation, est la transformation logarithmique (on parlera de variable
« log-transformée »). On a par exemple :
• log base 2 : +1 unité sur échelle logarithmique = multiplication par 2
sur échelle originale
• log base 10 : +1 unité sur échelle logarithmique = multiplication par 10
sur échelle originale.
En général, on utilisera pourtant le logarithme naturel (base e = 2.718...),
comme on le fera systématiquement dans ce texte (la notation « log » dénotant ainsi le logarithme naturel dans ce qui suit). Une variable Y pour laquelle
log(Y ) est normale est dite une variable log-normale. En utilisant l’approximation log(x + 1) ≈ x (excellente pour x ≤ 0.25), on aura alors :
log(a) − log(b) = log(a/b) = log
1 +
a − b
b
≈
a − b
b
.
14 On citera les résultats suivants pour une variable Y avec distribution (a) normale (avec
paramètres μ et σ), (b) continue uniforme (entre a et b), (c) binomiale (avec paramètres n et
π), (d) de Student (avec dl degrés de liberté), et (e) du khi-deux (avec dl degrés de liberté) :
mean(Y )
variance(Y )
skewness(Y )
kurtosis(Y )
(a)
μ
σ 2
0
0
(b)
(a + b)/2
(b − a) 2 /12
0
−1.2
(c)
nπ
nπ(1 − π)
(1− 2π)/
p
nπ(1 − π) (1− 6π(1 − π))/(nπ(1 − π))
(d)
0
dl/(dl − 2)
0
6/(dl − 4)
(e)
dl
2 · dl
p
8/dl
12/dl
Pour une distribution de Student, ces quatre résultats sont valables si respectivement dl > 1,
dl > 2, dl > 3 et dl > 4. On aura sinon mean(Y ) = ∞ si dl ≤ 1, variance(Y ) = ∞
si dl ≤ 2, skewness(Y ) = ∞ si dl ≤ 3 et kurtosis(Y ) = ∞ si dl ≤ 4. Les distributions
avec une mesure d’aplatissement positive sont dites leptokurtiques, celles avec une mesure
d’aplatissement négative sont dites platikurtiques. Par exemple, les distributions de Student
sont leptokurtiques alors qu’une distribution uniforme est platikurtique.
Précédent

- 45/327

Suivant