7
© Dunod – Toute reproduction non autorisée est un délit.
2
BASES DE DONNÉES
POUR DONNÉES DE BASES
2.1 LES BANQUES
DONNÉES GÉNÉRALISTES
DE
La problématique des données en biologie est très différente de celle d’autres disciplines. Les données biologiques présentent une forte hétérogénéité, ce qui pose la
question de l’information à en tirer, de leur structuration et des systèmes de requêtes
à développer pour pouvoir interroger de manière pertinente ces données. De plus,
elles sont fortement corrélées entre elles (exemple des séquences nucléiques et
protéiques à travers le code génétique). La qualité des données est très variable
(erreur de séquences, d’annotation, redondance). Pour les protéines, il existe principalement trois manières différentes d’interroger les banques de séquences : par
l’annotation des séquences dans la banque (commentaires, mots-clés associés)
comme illustré dans les figures 2.1 et 2.5, par comparaisons directes des séquences
décrites dans le chapitre 4, par numéro d’accession ou identifiant unique (exemple
du champ AC décrit au paragraphe 2.2).
Exemple d’erreur dans les banques de données
Pour mettre en évidence la présence d’erreur dans les banques de séquences,
l’utilisateur peut faire une requête sur le site du DKFZ http://www.dkfz.de/srs/
avec comme mot-clé « psuedogene » au lieu de « pseudogene ». La requête
suivante effectuée sur l’EMBL fournit plus de 80 entrées en 2012) !
PLAN
2.1 Banques de données généralistes
2.2 Une entrée Swiss-Prot
2.3 Interrogations SRS, ACNUC, Entrez
OBJECTIFS
➤ Comprendre l’intérêt des banques de données en biologie
➤ Connaître une entrée au format Swiss-Prot
➤ Savoir interroger les banques de données de séquences
© Dunod – Toute reproduction non autorisée est un délit.
2
BASES DE DONNÉES
POUR DONNÉES DE BASES
2.1 LES BANQUES
DONNÉES GÉNÉRALISTES
DE
La problématique des données en biologie est très différente de celle d’autres disciplines. Les données biologiques présentent une forte hétérogénéité, ce qui pose la
question de l’information à en tirer, de leur structuration et des systèmes de requêtes
à développer pour pouvoir interroger de manière pertinente ces données. De plus,
elles sont fortement corrélées entre elles (exemple des séquences nucléiques et
protéiques à travers le code génétique). La qualité des données est très variable
(erreur de séquences, d’annotation, redondance). Pour les protéines, il existe principalement trois manières différentes d’interroger les banques de séquences : par
l’annotation des séquences dans la banque (commentaires, mots-clés associés)
comme illustré dans les figures 2.1 et 2.5, par comparaisons directes des séquences
décrites dans le chapitre 4, par numéro d’accession ou identifiant unique (exemple
du champ AC décrit au paragraphe 2.2).
Exemple d’erreur dans les banques de données
Pour mettre en évidence la présence d’erreur dans les banques de séquences,
l’utilisateur peut faire une requête sur le site du DKFZ http://www.dkfz.de/srs/
avec comme mot-clé « psuedogene » au lieu de « pseudogene ». La requête
suivante effectuée sur l’EMBL fournit plus de 80 entrées en 2012) !
PLAN
2.1 Banques de données généralistes
2.2 Une entrée Swiss-Prot
2.3 Interrogations SRS, ACNUC, Entrez
OBJECTIFS
➤ Comprendre l’intérêt des banques de données en biologie
➤ Connaître une entrée au format Swiss-Prot
➤ Savoir interroger les banques de données de séquences
