Chapitre 2 • Bases de données pour données de bases
14
Le format standard et commun à tous les logiciels d’analyse en bioinformatique
est Person/Fasta. Les banques de données sont aussi proposées dans ce format.
Format PEARSON-FASTA compatible avec tous les logiciels d’analyse
>sw|P02159|MYG_LYCPI Myoglobin.
GLSDGEWQIVLNIWGKVETDLAGHGQEVLIRLFKNHPETLDKFDKFKHLKTEDEMKGSED
LKKHGNTVLTALGGILKKKGHHEAELKPLAQSHATKHKIPVKYLEFISDAIIQVLQNKHS
GDFHADTEAAMKKALELFRNDIAAKYKELGFQG
>sw|Q9DEP1|MYG_PSEGE Myoglobin.
ADFDMVLKCWGLVEADYATYGSLVLTRLFTEHPETLKLFPKFAGIAHGDLAGDAGVSAHG
ATVLNKLGDLLKARGGHAALLKPLSSSHATKHKIPIINFKLIAEVIGKVMEEKAGLDAAG
QTALRNVMAVIIADMEADYKELGFTE
>sw|P02201|MYG_GRAGE Myoglobin.
GLSDDEWHHVLGIWAKVEPDLSAHGQEVIIRLFQVHPETQERFAKFKNLKTIDELRSSEE
VKKHGTTVLTALGRILKLKNNHEPELKPLAESHATKHKIPVKYLEFICEIIVKVIAEKHP
SDFGADSQAAMRKALELFRNDMASKYKEFGFQG
Un utilitaire de conversion de formats (READSEQ) est proposé par D. Gilbert
(http://www.ebi.ac.uk/cgi-bin/readseq.cgi).
Le biologiste doit aussi faire attention aux caractères de fin et de saut de ligne qui
sont différents selon les systèmes d’exploitation. Pour convertir un fichier issu
d’un serveur Linux en un fichier MS Windows, il suffit de le charger dans Wordpad
et de le sauver. Les caractères seront automatiquement substitués.
2.2 U
SWISS-PROT
NE ENTRÉE
Dans une entrée Swiss-Prot (voir exemple pages suivantes), chaque fichier de
séquence obéit à un format propre à base d’étiquette (deux lettres) qui renseigne la
nature du champ d’information qui débute à la colonne 6 (http://web.expasy.org/
docs/userman.html#linetypes). La première étiquette est ID ( entifiant).
ID
Elle
contient le nom de la protéine. Un nom Swiss-Prot est constitué d’un préfixe souvent
évocateur du rôle ou de la fonction (ici MYG pour MYOGLOBIN), d’un séparateur,
le «
(caractère underscore ou blanc souligné
_ »
), et du nom (ou de son abréviation)
HUMAN de l’espèce (en anglais). Attention, ce nom est susceptible de changer au
cours des différentes versions de la banque. En effet, il se peut que la fonction ne soit
pas connue avec précision à une date donnée et que celle-ci soit étudiée et finalement
connue dans une version suivante. Le champ
(numéro d’
AC
ACcès) est affecté de
Tableau 2.4 – Principaux formats des séquences.
Banques de séquences
Phylogénie
Logiciels
Ig/Stanford
Phylip3.2
Fitch
Genbank/GB
Phylip
DNA strider
NBRF
Plain/Raw
AnTheProt
EMBL
PIR/CODATA
Olsen
GCG
MSF
Pretty
Pearson/Fasta
PAUP
Zuker
14
Le format standard et commun à tous les logiciels d’analyse en bioinformatique
est Person/Fasta. Les banques de données sont aussi proposées dans ce format.
Format PEARSON-FASTA compatible avec tous les logiciels d’analyse
>sw|P02159|MYG_LYCPI Myoglobin.
GLSDGEWQIVLNIWGKVETDLAGHGQEVLIRLFKNHPETLDKFDKFKHLKTEDEMKGSED
LKKHGNTVLTALGGILKKKGHHEAELKPLAQSHATKHKIPVKYLEFISDAIIQVLQNKHS
GDFHADTEAAMKKALELFRNDIAAKYKELGFQG
>sw|Q9DEP1|MYG_PSEGE Myoglobin.
ADFDMVLKCWGLVEADYATYGSLVLTRLFTEHPETLKLFPKFAGIAHGDLAGDAGVSAHG
ATVLNKLGDLLKARGGHAALLKPLSSSHATKHKIPIINFKLIAEVIGKVMEEKAGLDAAG
QTALRNVMAVIIADMEADYKELGFTE
>sw|P02201|MYG_GRAGE Myoglobin.
GLSDDEWHHVLGIWAKVEPDLSAHGQEVIIRLFQVHPETQERFAKFKNLKTIDELRSSEE
VKKHGTTVLTALGRILKLKNNHEPELKPLAESHATKHKIPVKYLEFICEIIVKVIAEKHP
SDFGADSQAAMRKALELFRNDMASKYKEFGFQG
Un utilitaire de conversion de formats (READSEQ) est proposé par D. Gilbert
(http://www.ebi.ac.uk/cgi-bin/readseq.cgi).
Le biologiste doit aussi faire attention aux caractères de fin et de saut de ligne qui
sont différents selon les systèmes d’exploitation. Pour convertir un fichier issu
d’un serveur Linux en un fichier MS Windows, il suffit de le charger dans Wordpad
et de le sauver. Les caractères seront automatiquement substitués.
2.2 U
SWISS-PROT
NE ENTRÉE
Dans une entrée Swiss-Prot (voir exemple pages suivantes), chaque fichier de
séquence obéit à un format propre à base d’étiquette (deux lettres) qui renseigne la
nature du champ d’information qui débute à la colonne 6 (http://web.expasy.org/
docs/userman.html#linetypes). La première étiquette est ID ( entifiant).
ID
Elle
contient le nom de la protéine. Un nom Swiss-Prot est constitué d’un préfixe souvent
évocateur du rôle ou de la fonction (ici MYG pour MYOGLOBIN), d’un séparateur,
le «
(caractère underscore ou blanc souligné
_ »
), et du nom (ou de son abréviation)
HUMAN de l’espèce (en anglais). Attention, ce nom est susceptible de changer au
cours des différentes versions de la banque. En effet, il se peut que la fonction ne soit
pas connue avec précision à une date donnée et que celle-ci soit étudiée et finalement
connue dans une version suivante. Le champ
(numéro d’
AC
ACcès) est affecté de
Tableau 2.4 – Principaux formats des séquences.
Banques de séquences
Phylogénie
Logiciels
Ig/Stanford
Phylip3.2
Fitch
Genbank/GB
Phylip
DNA strider
NBRF
Plain/Raw
AnTheProt
EMBL
PIR/CODATA
Olsen
GCG
MSF
Pretty
Pearson/Fasta
PAUP
Zuker
