2
Statistique appliquée aux sciences de la vie
sure de prévoir (voire même de modifier) les phénomènes étudiés. Pourquoi certaines plantes croissent-elles plus que d’autres ? Quelle hauteur
atteindra un Onobrychis particulier ? Comment prédire la variabilité ?
La statistique nous aide à répondre à ces questions. On distingue en particulier
les méthodes de statistique descriptive, qui traitent de la première problématique, des méthodes de statistique inférentielle, qui traitent de la deuxième.
Les techniques de modélisation statistique permettront dans une certaine mesure d’aborder la troisième de ces problématiques.
1.1 Population, variable et échantillon
Trois concepts essentiels de la statistique sont ceux de population, de variable et d’échantillon :
• la population est l’ensemble des individus d’intérêt d’une étude, que ce
soient des patients, des plantes, des insectes ou différents lancers d’une
pièce de monnaie ; avant d’entreprendre une étude ou une expérience, il
s’agit de définir autant précisément que possible qui nous intéresse
• une variable est une caractéristique d’intérêt mesurable sur les individus
de la population, par exemple l’âge d’un patient, la hauteur après une
culture de six mois d’un Onobrychis ou le résultat, pile ou face, du lancer
d’une pièce de monnaie ; il s’agit ici de définir quoi nous intéresse.
La répartition des différentes valeurs possibles d’une variable entre les individus
de la population est appelée la distribution de la variable dans la population.
Afin d’obtenir de l’information sur cette distribution, il ne suffit pas de mesurer
un seul individu de la population. Pour des raisons pratiques évidentes, on ne
peut pas non plus mesurer l’entier de la population, qui contient typiquement un
grand nombre, parfois même une infinité d’individus (on ne pourra pas planter
tous les Onobrychis susceptibles d’être plantés). Entre ces deux extrêmes, il
s’agit de trouver un compromis, et le compromis en statistique s’appelle un
échantillon. Ainsi :
• un échantillon est un ensemble de quelques individus représentatifs de
la population pour lesquels une variable est effectivement mesurée
2 .
On mentionnera à nouveau ici les rôles différents de la statistique descriptive et de la statistique inférentielle. La statistique descriptive nous permet de
résumer les données d’un échantillon. La statistique inférentielle nous permet
de faire le lien entre un échantillon et une population, nous informant sur ce
2 On utilisera le même terme d’échantillon pour désigner à la fois l’ensemble des individus
mesurés et l’ensemble des mesures (des observations) faites sur ces individus, c’est-à-dire
l’ensemble des données récoltées. On verra cependant au chapitre 9 qu’une distinction entre
ces deux concepts peut s’avérer utile dans certains cas.
Précédent

- 15/327

Suivant