© Dunod – Toute reproduction non autorisée est un délit.
11
2.1 • Les banques de données généralistes
structurale et intégrant les informations des autres banques de données. Du fait de sa
faible redondance, cette banque est particulièrement utile pour établir des statistiques
sur les protéines. Les premières banques de données (pas encore des bases de
données) étaient généralistes.
Depuis 25 ans, une explosion des bases de données spécialisées est observée
(1 380 répertoriées dans NAR).
La revue Nucleic Acids Research consacre un numéro spécial « database » chaque
année (
. Avant de se lancer dans un nouveau
http://www.oxfordjournals.org/nar/)
projet, il convient de vérifier qu’il n’
spécialisée maintenue
existe pas une banque
à jour.
Les bases de données spécialisées présentent l’avantage d’être maintenues par des
experts du domaine qui gèrent les problèmes de numérotation, nomenclature, cohérence, annotation. On peut distinguer les bases de données thématiques biologiques
(récepteurs couplés aux protéines G comme GPCR, ou immunologie IMGT), par
organisme (dont le génome est en général complètement séquencé), par technologie
(spectres RMN, cartes de spectrométrie de masse, gels d’électrophorèse bidimensionnelle) ou par type (séquence, structure, image, spectre, interaction). Le
tableau 2.1 recense quelques ressources notoires en bioinformatique.
L’accès aux génomes se fait grâce à des outils dédiés appelés genome browser. Le
serveur Ensembl (www.ensembl.org) répertorie les principaux génomes d’organismes modèles. Le serveur offre la possibilité de naviguer depuis le niveau caryotype (figure 2.4) jusqu’au niveau de la séquence nucléique et de sa traduction dans
les différentes phases de lecture.
II existe une seule banque de données des structures 3D des macromolécules
biologiques appelée historiquement la PDB (Protein Data Bank). Cette banque
(http://www.rcsb.org/) contient les coordonnées tridimensionnelles atomiques de
protéines, d’acides nucléiques, de complexes nucléo-protéiques, de sucres. La croissance de la banque est constante depuis 5 ans et représente environ 7 500 structures/an
en moyenne sur la période 2007-2011. En revanche, le nombre de structures présentant une architecture originale (repliement ou fold) est constant. Ainsi, le nombre de
repliements différents connus est d’environ 1 500 et représente la redondance en
structures 3D. La redondance en séquence fait qu’on peut distinguer environ
20 000 groupes de séquences qui partagent entre eux moins de 30 % d’identité.
Ainsi, il existe des versions de PDB à 95 % (PDB95), 75 % (PDB75) et 25 %
(PDB25).
Une banque de données est un ensemble de fichiers textes sans relation entre eux
(on parle de fichier « plat »). Une base de données est un ensemble de relations
entre des données gérées avec un système de gestion de base de données (SGBD)
et interrogeable par SQL (Structure Query Langage).
Différence entre base de données et banque de données
11
2.1 • Les banques de données généralistes
structurale et intégrant les informations des autres banques de données. Du fait de sa
faible redondance, cette banque est particulièrement utile pour établir des statistiques
sur les protéines. Les premières banques de données (pas encore des bases de
données) étaient généralistes.
Depuis 25 ans, une explosion des bases de données spécialisées est observée
(1 380 répertoriées dans NAR).
La revue Nucleic Acids Research consacre un numéro spécial « database » chaque
année (
. Avant de se lancer dans un nouveau
http://www.oxfordjournals.org/nar/)
projet, il convient de vérifier qu’il n’
spécialisée maintenue
existe pas une banque
à jour.
Les bases de données spécialisées présentent l’avantage d’être maintenues par des
experts du domaine qui gèrent les problèmes de numérotation, nomenclature, cohérence, annotation. On peut distinguer les bases de données thématiques biologiques
(récepteurs couplés aux protéines G comme GPCR, ou immunologie IMGT), par
organisme (dont le génome est en général complètement séquencé), par technologie
(spectres RMN, cartes de spectrométrie de masse, gels d’électrophorèse bidimensionnelle) ou par type (séquence, structure, image, spectre, interaction). Le
tableau 2.1 recense quelques ressources notoires en bioinformatique.
L’accès aux génomes se fait grâce à des outils dédiés appelés genome browser. Le
serveur Ensembl (www.ensembl.org) répertorie les principaux génomes d’organismes modèles. Le serveur offre la possibilité de naviguer depuis le niveau caryotype (figure 2.4) jusqu’au niveau de la séquence nucléique et de sa traduction dans
les différentes phases de lecture.
II existe une seule banque de données des structures 3D des macromolécules
biologiques appelée historiquement la PDB (Protein Data Bank). Cette banque
(http://www.rcsb.org/) contient les coordonnées tridimensionnelles atomiques de
protéines, d’acides nucléiques, de complexes nucléo-protéiques, de sucres. La croissance de la banque est constante depuis 5 ans et représente environ 7 500 structures/an
en moyenne sur la période 2007-2011. En revanche, le nombre de structures présentant une architecture originale (repliement ou fold) est constant. Ainsi, le nombre de
repliements différents connus est d’environ 1 500 et représente la redondance en
structures 3D. La redondance en séquence fait qu’on peut distinguer environ
20 000 groupes de séquences qui partagent entre eux moins de 30 % d’identité.
Ainsi, il existe des versions de PDB à 95 % (PDB95), 75 % (PDB75) et 25 %
(PDB25).
Une banque de données est un ensemble de fichiers textes sans relation entre eux
(on parle de fichier « plat »). Une base de données est un ensemble de relations
entre des données gérées avec un système de gestion de base de données (SGBD)
et interrogeable par SQL (Structure Query Langage).
Différence entre base de données et banque de données
