© Dunod – Toute reproduction non autorisée est un délit.
175
Cas pratique d’analyse de séquences
Réponse
Le fichier présente un histogramme qui renseigne l’utilisateur sur la modularité
des protéines : Le nombre de modules est indiqué par le nombre de pics dans
l’histogramme. Ici, il n’y a qu’un pic, donc un seul module couvrant toute la
longueur de la séquence X. Le lien le plus à gauche de la liste (NPSA) permet
d’analyser la séquence de la protéine correspondante via le serveur. Le deuxième
lien est un pointeur sur l’entrée de la banque UniProt. Le lien (positionné sur la E
value) le plus à droite est un pointeur sur l’alignement de la query (séquence X) et
la séquence de la banque UniProt.
Il peut être pertinent de sélectionner toutes les séquences d’ovomucoïdes (IOVO_
xxxx). Pour cela, on peut soit désélectionner les séquences indésirables soit
choisir un seuil de E() < 1 E
–15
dans le menu de sélection. Environ 150 séquences
répondent aux critères. Ceci indique que les séquences de cette famille sont très
proches les unes des autres. Il s’agit donc d’une famille homogène très probablement issue d’une évolution par divergence. Pour extraire les séquences d’intérêt,
choisir « Partial sequences from blastp alignments » et taper 45 à la place de 56
dans la fenêtre d’extraction. 45 signifie que seules les séquences qui présentent au
moins 45 résidus dans la partie 1-56 de la séquence X seront extraites. Cela
permet d’écarter les séquences beaucoup plus courtes.
Environ 90 séquences sont retenues (voir le critère précédent et la redondance est
éliminée). Ensuite l’alignement par CLUSTALW est lancé.
Sur le fichier, on peut noter l’excellente qualité de l’alignement (25 % d’identité
sur 90 séquences) ainsi que la stricte conservation des 6 Cystéines (comme
indiqué dans la recherche de signature) qui participent à la signature d’appartenance à la famille. Par ailleurs, cet alignement est résistant aux changements des
paramètres. Tous ces éléments sont en faveur d’une famille de protéines homologues.
Calcul de la phylogénie de ces protéines homologues
en utilisant le programme SeaView
1. Revenir à la page des résultats de recherche par Blastp.
2. Extraire les séquences complètes ayant une E-value < 10
-15
.
3. Copier les séquences extraites sur votre disque (clic droit sur « Database file
(text) ».
4. Installer le programme seaview sur votre ordinateur à partir de son site Web
(http://pbil.univ-lyon1.fr/software/seaview.html).
5. Lancer le programme, et glisser le fichier de séquences dans la fenêtre.
6. Transformer le fichier au format Nexus (menu « File/Save as... » puis choisir le
format Nexus et l’extension .nxs).
7. Aligner par clustal omega les séquences (menu « Align/Align all »).
8. Sélectionner les sites bien alignés par GBlocks (menu « Sites/Create set » puis
option « Gblocks ») et activer les options les moins stringentes.
175
Cas pratique d’analyse de séquences
Réponse
Le fichier présente un histogramme qui renseigne l’utilisateur sur la modularité
des protéines : Le nombre de modules est indiqué par le nombre de pics dans
l’histogramme. Ici, il n’y a qu’un pic, donc un seul module couvrant toute la
longueur de la séquence X. Le lien le plus à gauche de la liste (NPSA) permet
d’analyser la séquence de la protéine correspondante via le serveur. Le deuxième
lien est un pointeur sur l’entrée de la banque UniProt. Le lien (positionné sur la E
value) le plus à droite est un pointeur sur l’alignement de la query (séquence X) et
la séquence de la banque UniProt.
Il peut être pertinent de sélectionner toutes les séquences d’ovomucoïdes (IOVO_
xxxx). Pour cela, on peut soit désélectionner les séquences indésirables soit
choisir un seuil de E() < 1 E
–15
dans le menu de sélection. Environ 150 séquences
répondent aux critères. Ceci indique que les séquences de cette famille sont très
proches les unes des autres. Il s’agit donc d’une famille homogène très probablement issue d’une évolution par divergence. Pour extraire les séquences d’intérêt,
choisir « Partial sequences from blastp alignments » et taper 45 à la place de 56
dans la fenêtre d’extraction. 45 signifie que seules les séquences qui présentent au
moins 45 résidus dans la partie 1-56 de la séquence X seront extraites. Cela
permet d’écarter les séquences beaucoup plus courtes.
Environ 90 séquences sont retenues (voir le critère précédent et la redondance est
éliminée). Ensuite l’alignement par CLUSTALW est lancé.
Sur le fichier, on peut noter l’excellente qualité de l’alignement (25 % d’identité
sur 90 séquences) ainsi que la stricte conservation des 6 Cystéines (comme
indiqué dans la recherche de signature) qui participent à la signature d’appartenance à la famille. Par ailleurs, cet alignement est résistant aux changements des
paramètres. Tous ces éléments sont en faveur d’une famille de protéines homologues.
Calcul de la phylogénie de ces protéines homologues
en utilisant le programme SeaView
1. Revenir à la page des résultats de recherche par Blastp.
2. Extraire les séquences complètes ayant une E-value < 10
-15
.
3. Copier les séquences extraites sur votre disque (clic droit sur « Database file
(text) ».
4. Installer le programme seaview sur votre ordinateur à partir de son site Web
(http://pbil.univ-lyon1.fr/software/seaview.html).
5. Lancer le programme, et glisser le fichier de séquences dans la fenêtre.
6. Transformer le fichier au format Nexus (menu « File/Save as... » puis choisir le
format Nexus et l’extension .nxs).
7. Aligner par clustal omega les séquences (menu « Align/Align all »).
8. Sélectionner les sites bien alignés par GBlocks (menu « Sites/Create set » puis
option « Gblocks ») et activer les options les moins stringentes.
