Cas pratique d’analyse de séquences
176
9. Faire un premier arbre Neighbor-Joining avec 500 réplicats de bootstrap et la
distance de Kimura (menu « Trees/Distance methods »).
10. Dans la fenêtre d’arbre qui s’ouvre, faire menu « File/Save to trees menu » puis
« File/Save » dans la fenêtre de l’alignement.
11. Faire un second arbre en maximum de vraisemblance (menu « Trees/PhyML »)
en activant « Empirical » pour « Amino acid equilibrium frequencies ». Tant que
la nouvelle fenêtre indique « Wait for tree-building completion » en bas, c’est
que le calcul ( 2 min) se déroule. Quand il est fini, le bouton « OK » devient
actif. Noter la dernière valeur utilisée pour le paramètre alpha et la log-vraisemblance de l’arbre.
12. Cliquer sur OK pour faire apparaître l’arbre. Dans la fenêtre d’arbre, faire menu
« File/Save to trees menu » puis « File/Save » dans la fenêtre de l’alignement.
13. Comparer les deux arbres, en particulier les valeurs de soutien de bootstrap des
branches qui différent entre les deux arbres.
14. Calculer un autre arbre PhyML sans tenir compte de la variation du taux entre
sites. Comparer les temps de calcul et les log-vraisemblances des deux arbres
PhyML.
Réponse
L’alignement multiple indique que certaines protéines contiennent une longue
extension N-terminale qui est probablement un peptide signal. On voit aussi que
l’alignement des quatre premiers acides aminés des protéines est assez incertain,
mais que l’alignement de tout le reste de la protéine est absolument non ambigu.
On voit la différence de durée des calculs entre les deux méthodes employées. Les
scores de soutien de bootstrap sont généralement très faibles (activer « Bootstrap »
sur la fenêtre de l’arbre NJ). Ceci est une conséquence du fait que le nombre de
sites homologues analysés est très petit (51). Il y a un fort soutien de bootstrap
( 96%) pour la branche contenant la racine. Les arbres ont été racinés en leur centre,
et cette position de la racine définit deux groupes dont la séparation est statistiquement significative. En regardant les espèces auxquelles appartiennent les séquences
des deux côtés de la racine, on pourra déterminer si la racine correspond à une
spéciation ou une duplication génique. Les nombreuses différences de topologie
entre les deux arbres sont attendues puis
istiques des branches
que les soutiens stat
internes sont très faibles. La valeur estimée au maximum de vraisemblance du paramètre alpha ( 0,5) indique une forte hétérogénéité des vitesses d’évolution entre
sites de la protéine. Cela se voit sur l’alignement multiple qui contient aussi bien
des sites totalement invariants que des sites qui varient beaucoup.
Le deuxième arbre PhyML s’obtient en activant « None » dans le groupe
d’options « Across site rate variation ». Le temps de calcul ( 32 sec) est le quart
de celui du premier arbre, ce qui est attendu puisque il avait été calculé avec une
discrétisation de la distribution gamma en 4 catégories. Les deux log-vraisemblances obtenues sont -1488,60 pour le premier arbre et -1583,80 pour le second.
C’est la première log-vraisemblance qui est la plus élevée (deux nombres négatifs). La
176
9. Faire un premier arbre Neighbor-Joining avec 500 réplicats de bootstrap et la
distance de Kimura (menu « Trees/Distance methods »).
10. Dans la fenêtre d’arbre qui s’ouvre, faire menu « File/Save to trees menu » puis
« File/Save » dans la fenêtre de l’alignement.
11. Faire un second arbre en maximum de vraisemblance (menu « Trees/PhyML »)
en activant « Empirical » pour « Amino acid equilibrium frequencies ». Tant que
la nouvelle fenêtre indique « Wait for tree-building completion » en bas, c’est
que le calcul ( 2 min) se déroule. Quand il est fini, le bouton « OK » devient
actif. Noter la dernière valeur utilisée pour le paramètre alpha et la log-vraisemblance de l’arbre.
12. Cliquer sur OK pour faire apparaître l’arbre. Dans la fenêtre d’arbre, faire menu
« File/Save to trees menu » puis « File/Save » dans la fenêtre de l’alignement.
13. Comparer les deux arbres, en particulier les valeurs de soutien de bootstrap des
branches qui différent entre les deux arbres.
14. Calculer un autre arbre PhyML sans tenir compte de la variation du taux entre
sites. Comparer les temps de calcul et les log-vraisemblances des deux arbres
PhyML.
Réponse
L’alignement multiple indique que certaines protéines contiennent une longue
extension N-terminale qui est probablement un peptide signal. On voit aussi que
l’alignement des quatre premiers acides aminés des protéines est assez incertain,
mais que l’alignement de tout le reste de la protéine est absolument non ambigu.
On voit la différence de durée des calculs entre les deux méthodes employées. Les
scores de soutien de bootstrap sont généralement très faibles (activer « Bootstrap »
sur la fenêtre de l’arbre NJ). Ceci est une conséquence du fait que le nombre de
sites homologues analysés est très petit (51). Il y a un fort soutien de bootstrap
( 96%) pour la branche contenant la racine. Les arbres ont été racinés en leur centre,
et cette position de la racine définit deux groupes dont la séparation est statistiquement significative. En regardant les espèces auxquelles appartiennent les séquences
des deux côtés de la racine, on pourra déterminer si la racine correspond à une
spéciation ou une duplication génique. Les nombreuses différences de topologie
entre les deux arbres sont attendues puis
istiques des branches
que les soutiens stat
internes sont très faibles. La valeur estimée au maximum de vraisemblance du paramètre alpha ( 0,5) indique une forte hétérogénéité des vitesses d’évolution entre
sites de la protéine. Cela se voit sur l’alignement multiple qui contient aussi bien
des sites totalement invariants que des sites qui varient beaucoup.
Le deuxième arbre PhyML s’obtient en activant « None » dans le groupe
d’options « Across site rate variation ». Le temps de calcul ( 32 sec) est le quart
de celui du premier arbre, ce qui est attendu puisque il avait été calculé avec une
discrétisation de la distribution gamma en 4 catégories. Les deux log-vraisemblances obtenues sont -1488,60 pour le premier arbre et -1583,80 pour le second.
C’est la première log-vraisemblance qui est la plus élevée (deux nombres négatifs). La
