276
9 Google et l’algorithme PageRank
les mots techniques abondent en m´ edecine, tous les m´ edecins, infirmiers et professionnels
de la sant´ e les connaissent. Tous pourront donc fouiller dans les bases de donn´ ees efficacement. Le rythme de progression de la base de donn´ ees est, pour tous ces exemples,
relativement lent. Dans une biblioth` eque, peu de livres disparaissent chaque ann´ ee, et
les ajouts d´ epassent rarement 10 % de la collection en place. Ajoutons `
a cela que le
titre des livres, leur cote, leurs auteurs, etc., ne changent pas ! La mise ` a jour de la base
de donn´ ees peut donc ˆ etre faite par des humains. Enfin, un consensus peut ˆ etre facilement ´ etabli sur la qualit´ e de l’information ` a r´ epertorier. Dans tous les d´ epartements
d’universit´ e, un comit´ e est charg´ e de recommander les achats des biblioth` eques qui les
desservent. De plus, les professeurs aiguilleront leurs ´ etudiants vers les meilleurs livres
pour leurs cours.
Aucune de ces caract´ eristiques n’existe sur la Toile. Les pages qui s’y cˆ otoient ont les
fonctions les plus diverses : information technique ou professionnelle, promotionnelle,
commerciale, culturelle, etc. La qualit´ e va du nec plus ultra ` a la m´ ediocrit´ e absolue : on
peut s’attendre `
a beaucoup de fautes d’orthographe et `
a des erreurs dans les informations
mˆ emes qui sont disponibles (que ces erreurs soient volontaires ou non). Les utilisateurs
sont aussi nombreux que les fonctions des diverses pages qui se trouvent sur la Toile,
et leur niveau de familiarit´ e avec les outils de recherche est extrˆ emement variable. La
Toile continue de se d´ evelopper ` a un rythme effr´ en´ e. Actuellement, Google catalogue
des dizaines de milliards de pages. Un grand nombre apparaissent chaque jour. Et quoi
de plus ´ eph´ em` ere que les pages produites par un seul individu. Enfin, il semble illusoire
d’´ etablir un consensus sur la qualit´ e ou l’ordre des pages ´ etant donn´ e leur nombre, leur
diversit´ e et celle des int´ erˆ ets des centaines de millions d’utilisateurs. Les pages de la
Toile n’ont rien en commun !
En fait, ceci est faux. Les pages de la Toile ont quelque chose en commun. Elles
sont ´ ecrites dans le langage de codage HTML (hypertext markup language) ou dans un
de ses dialectes. Et elle sont reli´ ees l’une `
a l’autre de mani` ere uniforme ; les liens entre
pages sont toujours annonc´ es dans le code HTML par quelques symboles pr´ ec´ edant
leur adresse, c’est-` a-dire leur URL (uniform resource locator). Ce sont pr´ ecis´ ement ces
liens qu’un humain peut suivre pour se promener sur la Toile et qu’un ordinateur peut
diff´ erencier du texte ou des images qui constituent les ´ el´ ements importants pour les
humains. En janvier 1998, quatre chercheurs de l’Universit´ e Stanford, L. Page, S. Brin,
R. Motwani et T. Winograd [1], proposaient un algorithme pour ordonner les pages de
la Toile. Cet algorithme, le PageRank, utilise, non pas le contenu textuel ou visuel des
pages, mais la structure des liens entre elles
3 .
3 Les quatre premi` eres lettres du nom PageRank r´ ef` erent au premier auteur de ce rapport
technique et non aux pages de la Toile que l’algorithme ordonne.
9 Google et l’algorithme PageRank
les mots techniques abondent en m´ edecine, tous les m´ edecins, infirmiers et professionnels
de la sant´ e les connaissent. Tous pourront donc fouiller dans les bases de donn´ ees efficacement. Le rythme de progression de la base de donn´ ees est, pour tous ces exemples,
relativement lent. Dans une biblioth` eque, peu de livres disparaissent chaque ann´ ee, et
les ajouts d´ epassent rarement 10 % de la collection en place. Ajoutons `
a cela que le
titre des livres, leur cote, leurs auteurs, etc., ne changent pas ! La mise ` a jour de la base
de donn´ ees peut donc ˆ etre faite par des humains. Enfin, un consensus peut ˆ etre facilement ´ etabli sur la qualit´ e de l’information ` a r´ epertorier. Dans tous les d´ epartements
d’universit´ e, un comit´ e est charg´ e de recommander les achats des biblioth` eques qui les
desservent. De plus, les professeurs aiguilleront leurs ´ etudiants vers les meilleurs livres
pour leurs cours.
Aucune de ces caract´ eristiques n’existe sur la Toile. Les pages qui s’y cˆ otoient ont les
fonctions les plus diverses : information technique ou professionnelle, promotionnelle,
commerciale, culturelle, etc. La qualit´ e va du nec plus ultra ` a la m´ ediocrit´ e absolue : on
peut s’attendre `
a beaucoup de fautes d’orthographe et `
a des erreurs dans les informations
mˆ emes qui sont disponibles (que ces erreurs soient volontaires ou non). Les utilisateurs
sont aussi nombreux que les fonctions des diverses pages qui se trouvent sur la Toile,
et leur niveau de familiarit´ e avec les outils de recherche est extrˆ emement variable. La
Toile continue de se d´ evelopper ` a un rythme effr´ en´ e. Actuellement, Google catalogue
des dizaines de milliards de pages. Un grand nombre apparaissent chaque jour. Et quoi
de plus ´ eph´ em` ere que les pages produites par un seul individu. Enfin, il semble illusoire
d’´ etablir un consensus sur la qualit´ e ou l’ordre des pages ´ etant donn´ e leur nombre, leur
diversit´ e et celle des int´ erˆ ets des centaines de millions d’utilisateurs. Les pages de la
Toile n’ont rien en commun !
En fait, ceci est faux. Les pages de la Toile ont quelque chose en commun. Elles
sont ´ ecrites dans le langage de codage HTML (hypertext markup language) ou dans un
de ses dialectes. Et elle sont reli´ ees l’une `
a l’autre de mani` ere uniforme ; les liens entre
pages sont toujours annonc´ es dans le code HTML par quelques symboles pr´ ec´ edant
leur adresse, c’est-` a-dire leur URL (uniform resource locator). Ce sont pr´ ecis´ ement ces
liens qu’un humain peut suivre pour se promener sur la Toile et qu’un ordinateur peut
diff´ erencier du texte ou des images qui constituent les ´ el´ ements importants pour les
humains. En janvier 1998, quatre chercheurs de l’Universit´ e Stanford, L. Page, S. Brin,
R. Motwani et T. Winograd [1], proposaient un algorithme pour ordonner les pages de
la Toile. Cet algorithme, le PageRank, utilise, non pas le contenu textuel ou visuel des
pages, mais la structure des liens entre elles
3 .
3 Les quatre premi` eres lettres du nom PageRank r´ ef` erent au premier auteur de ce rapport
technique et non aux pages de la Toile que l’algorithme ordonne.
