Chapitre 2 • Bases de données pour données de bases
10
Ainsi, la définition même de ce qu’est une protéine est différente pour l’informaticien (qui voit souvent un mot), pour un biologiste (qui voit un intermédiaire dans
une chaîne fonctionnelle), pour le biochimiste (qui y associera une activité enzymatique) et pour un chimiste (qui y associera un assemblage d’un grand nombre d’atomes).
Le programme 10 000 génomes humains
À titre d’illustration, le programme 10 000 génomes humains (http://
www.uk10k.org/) lancé en 2010 par le Sanger Institute pour étudier la variabilité
génétique humaine a généré en 6 mois un volume de données équivalent au
contenu accumulé dans GENBANK pendant 20 ans ! D’autres projets de séquençage sont en cours comme le séquençage de 10
génomes de vertébrés.
000
La mouvance des données biologiques (quantité et qualité) oblige de refaire régulièrement les analyses bioinformatiques.
L’information biologique est :
– disséminée dans une multitude de banques de données ;
– stockée sous des formats syntaxiquement hétérogènes ;
– en général non disponible dans des systèmes de gestion de bases de données
(SGDB) mais distribuée sous forme de fichiers plats ;
– modélisée dans ces différentes banques selon des sémantiques hétérogènes et
difficiles à mettre en relation.
Au début de la biologie moderne, les séquences nucléiques et protéiques étaient
déposées dans un grand livre édité par Margaret Dayhoff. Cet atlas des séquences a
été remis à jour périodiquement jusqu’en 1978. Les premières banques informatisées de données de séquences biologiques ont été développées à Lyon par C. Gautier
dans les années 1980 au Laboratoire de Biométrie et de Biologie Évolutive. Depuis,
plusieurs initiatives européennes (EMBL, devenue aujourd’hui l’ENA), américaine
(GenBank) ou japonaise (DDBJ) ont émergé de manière concurrente et parallèle
pour collecter l’ensemble des séquences génomiques. Depuis 1995, ces trois organisations ont passé des accords d’échanges mutuels de données, ce qui a pour résultat
que toute nouvelle séquence incluse dans une banque est automatiquement intégrée
dans les deux autres. Aujourd’hui, les trois banques font partie du consortium International Nucleotide Sequence Databases Collaboration (INSDC). Ce consortium
fait que les trois banques ayant un souci d’exhaustivité ont un contenu quantitatif et
qualitatif assez comparable et qui a tendance à converger. Les deux plus grands
centres de bioinformatique du monde sont l’Institut Européen de Bioinformatique
(EBI) à Hinxton, au Royaume-Uni (http://ebi.ac.uk/), et le National Center for
Biotechnology Information (NCBI), à Bethesda aux États-Unis (http://
ncbi.nlm.nih.gov/), qui rassemblent la plupart des banques de données. Enfin, depuis
1986, il faut souligner l’initiative d’A. Bairoch de créer une banque de séquences de
protéines Swiss-Prot (http://www.uniprot.org/) devenue UniProtKB/Swiss-Prot qui
soit non redondante et de haute qualité car riche en annotations fonctionnelles et
10
Ainsi, la définition même de ce qu’est une protéine est différente pour l’informaticien (qui voit souvent un mot), pour un biologiste (qui voit un intermédiaire dans
une chaîne fonctionnelle), pour le biochimiste (qui y associera une activité enzymatique) et pour un chimiste (qui y associera un assemblage d’un grand nombre d’atomes).
Le programme 10 000 génomes humains
À titre d’illustration, le programme 10 000 génomes humains (http://
www.uk10k.org/) lancé en 2010 par le Sanger Institute pour étudier la variabilité
génétique humaine a généré en 6 mois un volume de données équivalent au
contenu accumulé dans GENBANK pendant 20 ans ! D’autres projets de séquençage sont en cours comme le séquençage de 10
génomes de vertébrés.
000
La mouvance des données biologiques (quantité et qualité) oblige de refaire régulièrement les analyses bioinformatiques.
L’information biologique est :
– disséminée dans une multitude de banques de données ;
– stockée sous des formats syntaxiquement hétérogènes ;
– en général non disponible dans des systèmes de gestion de bases de données
(SGDB) mais distribuée sous forme de fichiers plats ;
– modélisée dans ces différentes banques selon des sémantiques hétérogènes et
difficiles à mettre en relation.
Au début de la biologie moderne, les séquences nucléiques et protéiques étaient
déposées dans un grand livre édité par Margaret Dayhoff. Cet atlas des séquences a
été remis à jour périodiquement jusqu’en 1978. Les premières banques informatisées de données de séquences biologiques ont été développées à Lyon par C. Gautier
dans les années 1980 au Laboratoire de Biométrie et de Biologie Évolutive. Depuis,
plusieurs initiatives européennes (EMBL, devenue aujourd’hui l’ENA), américaine
(GenBank) ou japonaise (DDBJ) ont émergé de manière concurrente et parallèle
pour collecter l’ensemble des séquences génomiques. Depuis 1995, ces trois organisations ont passé des accords d’échanges mutuels de données, ce qui a pour résultat
que toute nouvelle séquence incluse dans une banque est automatiquement intégrée
dans les deux autres. Aujourd’hui, les trois banques font partie du consortium International Nucleotide Sequence Databases Collaboration (INSDC). Ce consortium
fait que les trois banques ayant un souci d’exhaustivité ont un contenu quantitatif et
qualitatif assez comparable et qui a tendance à converger. Les deux plus grands
centres de bioinformatique du monde sont l’Institut Européen de Bioinformatique
(EBI) à Hinxton, au Royaume-Uni (http://ebi.ac.uk/), et le National Center for
Biotechnology Information (NCBI), à Bethesda aux États-Unis (http://
ncbi.nlm.nih.gov/), qui rassemblent la plupart des banques de données. Enfin, depuis
1986, il faut souligner l’initiative d’A. Bairoch de créer une banque de séquences de
protéines Swiss-Prot (http://www.uniprot.org/) devenue UniProtKB/Swiss-Prot qui
soit non redondante et de haute qualité car riche en annotations fonctionnelles et
