© Dunod – Toute reproduction non autorisée est un délit.
97
7.5 • Choix des méthodes de calcul d’arbres
7.5 CHOIX
’
DES MÉTHODES DE CALCUL D ARBRES
L’approche au maximum de vraisemblance est la méthode à privilégier pour la
reconstruction d’arbres phylogénétiques à partir d’alignements de séquences nucléotidiques ou protéiques. En effet, cette méthode a l’avantage d’expliciter toutes les
hypothèses qu’elle demande, et elle fournit des garanties théoriques de succès si ces
hypothèses sont satisfaites par les données étudiées.
Au contraire, dans son principe, la méthode de parcimonie ignore la longueur des
lignées évolutives : un changement a la même chance de se produire sur une branche
quelle que soit sa longueur. C’est une façon de représenter le processus évolutif
moins exacte que celle mise en œuvre par les approches probabilistes.
Des expériences de simulation de l’évolution de séquences le long d’arbres phylogénétiques connus ont démontré que l’approche au maximum de vraisemblance est
plus précise que les approches par les méthodes de distances ou par la parcimonie.
Le temps de calcul exigé par une reconstruction au maximum de vraisemblance
est généralement équivalent à celui demandé par la méthode de parcimonie, et très
supérieur à celui d’une analyse en distances. Puisque l’approche par parcimonie est
moins performante que celle par maximum de vraisemblance, demande environ le
même temps de calcul et ne produit pas des longueurs de branches précises, cette
approche est aujourd’hui rarement utilisée en phylogénie moléculaire.
Le temps de calcul est grossièrement proportionnel au nombre de sites de l’alignement analysé. Il augmente exponentiellement avec le nombre de séquences traitées.
Pour 500 séquences de 1 500 nucléotides, une analyse par PhyML demande de l’ordre
de 12 minutes. Il est donc possible d’analyser des alignements de quelques centaines
de séquences par PhyML, et de faire une centaine de réplicats de bootstrap. Les jeux
de données bien plus grands (en nombre de séquences surtout, mais aussi en nombre
de sites) peuvent rendre difficile une analyse au maximum de vraisemblance. Une
analyse par des méthodes de distances sera alors utile. Étant très rapides, les analyses
en distances sont aussi très efficaces pour avoir une première perception de l’organisation d’un ensemble de séquences homologues en groupes de proches parents.
97
7.5 • Choix des méthodes de calcul d’arbres
7.5 CHOIX
’
DES MÉTHODES DE CALCUL D ARBRES
L’approche au maximum de vraisemblance est la méthode à privilégier pour la
reconstruction d’arbres phylogénétiques à partir d’alignements de séquences nucléotidiques ou protéiques. En effet, cette méthode a l’avantage d’expliciter toutes les
hypothèses qu’elle demande, et elle fournit des garanties théoriques de succès si ces
hypothèses sont satisfaites par les données étudiées.
Au contraire, dans son principe, la méthode de parcimonie ignore la longueur des
lignées évolutives : un changement a la même chance de se produire sur une branche
quelle que soit sa longueur. C’est une façon de représenter le processus évolutif
moins exacte que celle mise en œuvre par les approches probabilistes.
Des expériences de simulation de l’évolution de séquences le long d’arbres phylogénétiques connus ont démontré que l’approche au maximum de vraisemblance est
plus précise que les approches par les méthodes de distances ou par la parcimonie.
Le temps de calcul exigé par une reconstruction au maximum de vraisemblance
est généralement équivalent à celui demandé par la méthode de parcimonie, et très
supérieur à celui d’une analyse en distances. Puisque l’approche par parcimonie est
moins performante que celle par maximum de vraisemblance, demande environ le
même temps de calcul et ne produit pas des longueurs de branches précises, cette
approche est aujourd’hui rarement utilisée en phylogénie moléculaire.
Le temps de calcul est grossièrement proportionnel au nombre de sites de l’alignement analysé. Il augmente exponentiellement avec le nombre de séquences traitées.
Pour 500 séquences de 1 500 nucléotides, une analyse par PhyML demande de l’ordre
de 12 minutes. Il est donc possible d’analyser des alignements de quelques centaines
de séquences par PhyML, et de faire une centaine de réplicats de bootstrap. Les jeux
de données bien plus grands (en nombre de séquences surtout, mais aussi en nombre
de sites) peuvent rendre difficile une analyse au maximum de vraisemblance. Une
analyse par des méthodes de distances sera alors utile. Étant très rapides, les analyses
en distances sont aussi très efficaces pour avoir une première perception de l’organisation d’un ensemble de séquences homologues en groupes de proches parents.
