Les lois de probabilités 139
Ce qui est surprenant, c’est que les rangs influent sur le nombre réel de sorties des
mots dans un texte. Le mot « the » apparaîtra deux fois plus que « of » et trois fois
plus que « and », et ainsi de suite. Le nombre réel est donné par une formule célèbre.
C’est une loi expérimentale que Zipf découvrit à partir de l’analyse de données.
Selon la loi théorique de Zipf, le pourcentage de sorties du mot placé au rang r est
donné par la formule :
k
— × 100
r
où k ne dépend que de l’étendue du vocabulaire de l’auteur. Si un auteur maîtrisait
tous les mots de la langue anglaise, qui en compte environ un million, selon certaines estimations, la valeur de k serait d’environ 0,0694. Dans la formule de la loi
de Zipf, le mot « the » représenterait environ 6,94 % de tous les mots d’un texte. De
la même façon, « of » en représenterait la moitié, c’est-à-dire environ 3,47 % de tous
les mots. Un essai de 3 000 mots rédigé par un auteur aussi talentueux contiendrait
par conséquent 208 sorties de « the » et 104 du mot « of ».
Pour les écrivains qui ne maîtrisent que 20 000 mots, la valeur de k passe à 0,0954,
et il y aurait donc 286 sorties de « the » et 143 du mot « of ». Plus le vocabulaire est
limité, plus il y a de sorties du mot « the ».
Voyance Que ce soit Poisson, Benford, ou Zipf, toutes ces lois nous permettent
de faire des prédictions. Peut-être est-il impossible de prédire des événements avec
100 % de certitude, mais il vaut mieux connaître les lois de probabilités plutôt que
de se lancer à l’aveuglette. En plus de ces trois lois, s’en ajoutent d’autres telles que
la loi binomiale, la loi binomiale négative, la loi hypergéométrique, et bien d’autres
encore, et le statisticien dispose ainsi d’une batterie d’outils efficaces pour analyser
un vaste champ d’activités humaines.
l’idée clé
La prédiction
de la quantité
Ce qui est surprenant, c’est que les rangs influent sur le nombre réel de sorties des
mots dans un texte. Le mot « the » apparaîtra deux fois plus que « of » et trois fois
plus que « and », et ainsi de suite. Le nombre réel est donné par une formule célèbre.
C’est une loi expérimentale que Zipf découvrit à partir de l’analyse de données.
Selon la loi théorique de Zipf, le pourcentage de sorties du mot placé au rang r est
donné par la formule :
k
— × 100
r
où k ne dépend que de l’étendue du vocabulaire de l’auteur. Si un auteur maîtrisait
tous les mots de la langue anglaise, qui en compte environ un million, selon certaines estimations, la valeur de k serait d’environ 0,0694. Dans la formule de la loi
de Zipf, le mot « the » représenterait environ 6,94 % de tous les mots d’un texte. De
la même façon, « of » en représenterait la moitié, c’est-à-dire environ 3,47 % de tous
les mots. Un essai de 3 000 mots rédigé par un auteur aussi talentueux contiendrait
par conséquent 208 sorties de « the » et 104 du mot « of ».
Pour les écrivains qui ne maîtrisent que 20 000 mots, la valeur de k passe à 0,0954,
et il y aurait donc 286 sorties de « the » et 143 du mot « of ». Plus le vocabulaire est
limité, plus il y a de sorties du mot « the ».
Voyance Que ce soit Poisson, Benford, ou Zipf, toutes ces lois nous permettent
de faire des prédictions. Peut-être est-il impossible de prédire des événements avec
100 % de certitude, mais il vaut mieux connaître les lois de probabilités plutôt que
de se lancer à l’aveuglette. En plus de ces trois lois, s’en ajoutent d’autres telles que
la loi binomiale, la loi binomiale négative, la loi hypergéométrique, et bien d’autres
encore, et le statisticien dispose ainsi d’une batterie d’outils efficaces pour analyser
un vaste champ d’activités humaines.
l’idée clé
La prédiction
de la quantité
