18
Statistique appliquée aux sciences de la vie
vers la droite (et donc non normale) : le quantile 50 % est plus proche du
quantile 25 % que du quantile 75 %, plus proche du minimum que du maximium,
et les trois valeurs extrêmes se trouvent à droite de la distribution. Le boxplot
du bas de la figure 2.8 résume les racines carrées des aires de ces hématomes
(interprétables comme des diamètres exprimés en mm). La distribution est ici
parfaitement symétrique et les valeurs extrêmes ont disparu, ou plutôt, elles
ont été réconciliées avec les données. On est donc proche de la normalité, ce
qui nous suggère que l’échelle adéquate (l’échelle naturelle) pour une analyse
statistique de cette variable est le diamètre de l’hématome plutôt que son aire.
2.5 Mesures de tendance centrale
On considère un ensemble de n observations y 1 , y 2 , · · · , y n d’une variable
quantitative Y . En statistique descriptive, on est intéressé à définir des caractéristiques numériques qui résument la distribution d’un ensemble de données.
Une mesure de tendance centrale est une caractéristique numérique nous informant sur la position du centre (du milieu) des données. Parmi celles-ci, on a
notamment la moyenne arithmétique (en anglais : mean), aussi appelée simplement « moyenne », et la médiane (en anglais : median), aussi appelée « quantile
50 % ». Ces quantités sont définies comme suit :
• la moyenne
7 :
mean(Y ) =
1
n
i
y i
→ la moyenne est la somme des observations divisée par le nombre des
observations
7 Dans ce qui suit, la notation
P
i y i (que l’on devrait en fait écrire
P n
i=1 y i ) désignera la
somme des observations y i :
X
i
y i = y 1 + y 2 + · · · + yn.
Notons que ces sommes sont remplacées par des intégrales si on a une infinité d’observations.
Pour une variable continue Y avec densité f (y), la moyenne d’une population infinie est ainsi
définie par :
mean(Y ) =
Z ∞
−∞
yf (y) dy
alors que la variance (concept que l’on verra plus loin) de cette population est définie par :
variance(Y ) =
Z ∞
−∞
(y − mean(Y ))
2 f (y) dy.
Pour une variable Y quantitative discrète, on aura par contre :
mean(Y ) =
X
y
y · Pr{Y = y} et variance(Y ) =
X
y
(y − mean(Y ))
2 · Pr{Y = y}
où ces sommes s’effectuent sur les différentes valeurs possibles y de la variable Y et où les
Pr{Y = y} dénotent les probabilités d’obtenir ces différentes valeurs.
Précédent

- 30/327

Suivant