© Dunod – Toute reproduction non autorisée est un délit.
19
2.3 • Les interrogations Entrez, ACNUC, SRS
• à l’aide du programme client « query_win » qui permet d’interroger les banques à
travers le réseau en utilisant une interface graphique ;
• à travers une interface programmable pour les langages C, C++, Python et R qui
permet de requêter les banques en réseau.
Le système SRS (figure 2.1) a été développé initialement pour permettre l’interrogation simultanée de plusieurs banques. Ainsi, la recherche dans une banque
implique que la requête soit effectuée sur la version stable de la banque et sur les
mises à jour (update) permettant d’avoir une interrogation exhaustive. Un serveur
SRS s’installe sur des sites hébergeant des banques et des outils. Le plus complet de
ces serveurs SRS est celui de l’EBI (http://srs.ebi.ac.uk). ACNUC et SRS reposent
sur un système d’indexation qui se caractérise par une bonne performance en lecture
(typiquement à l’utilisation par le biologiste) mais aussi par une incapacité de modification dynamique du système d’index. Ces deux systèmes sont donc performants
en mode lecture mais pas en mode écriture. À l’opposé, les Systèmes de Gestion de
Bases de Données (SGBD) sont efficaces en écriture (et parfois un peu moins en
lecture). La plupart des banques de données sont maintenant disponibles dans des
SGBD (Oracle, Sybase, db2, MySQL, PostgreSQL). Cependant, les plus performants de ces SGBD sont commerciaux et tous nécessitent de savoir quels types
d’interrogations devront être faits afin d’optimiser la structure de la base de données.
De plus, le temps de chargement nécessaire en cas de changement d’architecture
peut être très long (plusieurs jours pour EMBL). Les bases de données sont interrogeables à l’aide d’un langage standard de requête Structured Query Language (SQL)
et la plupart des bases de données biologiques offrent une interface avec le Web via
un formulaire le plus souvent écrit en python, PHP (PHP : hypertext Preprocessor),
Perl ou Java. À noter qu’il existe aussi une tendance actuelle au NoSQL (Not only
SQL) avec par exemple MongoDB (www.mongodb.org/) qui ne nécessite pas de
schéma prédéfini des données et qui permet l’évolution des champs au cours du
temps. Ce type d’outil est pa
s données ou des documents
rticulièrement utile pour de
qui sont changeants et de volume important (
) comme la biologie récente.
big data
Enfin, il faut mentionner le cloud computing ou nuage en plein développement pour
affranchir l’utilisateur de lien direct avec une machine de calcul et qui stocke les
données quelque part dans le « nuage » sur des systèmes informatiques distribués et
inconnus de l’utilisateur.
19
2.3 • Les interrogations Entrez, ACNUC, SRS
• à l’aide du programme client « query_win » qui permet d’interroger les banques à
travers le réseau en utilisant une interface graphique ;
• à travers une interface programmable pour les langages C, C++, Python et R qui
permet de requêter les banques en réseau.
Le système SRS (figure 2.1) a été développé initialement pour permettre l’interrogation simultanée de plusieurs banques. Ainsi, la recherche dans une banque
implique que la requête soit effectuée sur la version stable de la banque et sur les
mises à jour (update) permettant d’avoir une interrogation exhaustive. Un serveur
SRS s’installe sur des sites hébergeant des banques et des outils. Le plus complet de
ces serveurs SRS est celui de l’EBI (http://srs.ebi.ac.uk). ACNUC et SRS reposent
sur un système d’indexation qui se caractérise par une bonne performance en lecture
(typiquement à l’utilisation par le biologiste) mais aussi par une incapacité de modification dynamique du système d’index. Ces deux systèmes sont donc performants
en mode lecture mais pas en mode écriture. À l’opposé, les Systèmes de Gestion de
Bases de Données (SGBD) sont efficaces en écriture (et parfois un peu moins en
lecture). La plupart des banques de données sont maintenant disponibles dans des
SGBD (Oracle, Sybase, db2, MySQL, PostgreSQL). Cependant, les plus performants de ces SGBD sont commerciaux et tous nécessitent de savoir quels types
d’interrogations devront être faits afin d’optimiser la structure de la base de données.
De plus, le temps de chargement nécessaire en cas de changement d’architecture
peut être très long (plusieurs jours pour EMBL). Les bases de données sont interrogeables à l’aide d’un langage standard de requête Structured Query Language (SQL)
et la plupart des bases de données biologiques offrent une interface avec le Web via
un formulaire le plus souvent écrit en python, PHP (PHP : hypertext Preprocessor),
Perl ou Java. À noter qu’il existe aussi une tendance actuelle au NoSQL (Not only
SQL) avec par exemple MongoDB (www.mongodb.org/) qui ne nécessite pas de
schéma prédéfini des données et qui permet l’évolution des champs au cours du
temps. Ce type d’outil est pa
s données ou des documents
rticulièrement utile pour de
qui sont changeants et de volume important (
) comme la biologie récente.
big data
Enfin, il faut mentionner le cloud computing ou nuage en plein développement pour
affranchir l’utilisateur de lien direct avec une machine de calcul et qui stocke les
données quelque part dans le « nuage » sur des systèmes informatiques distribués et
inconnus de l’utilisateur.
