Chapitre 6 • Bases théoriques de la phylogénie moléculaire
68
Le modèle markovien et tous les résultats présentés jusqu’ici s’appliquent également aux séquences protéiques en utilisant une matrice de dimension 20.
Q
Pour pouvoir appliquer ce modèle markovien de l’évolution moléculaire, il faut
connaître les valeurs de ses paramètres, les termes non diagonaux de la matrice Q.
Pour les séquences nucléotidiques, ces valeurs sont estimées à partir des jeux de
séquences analysés. Pour les séquences protéiques, la dimension 20 de Q augmente
considérablement le nombre de paramètres. Ceux-ci sont donc estimés de manière
empirique une fois pour toutes à partir d’une vaste compilation de familles de
séquences homologues, puis réutilis
jeu de données.
és pour chaque
6.3.2 Quelques modèles nucléotidiques de Markov
Dans sa forme la plus générale, la matrice Q (figure 6.6) possède douze paramètres
libres qu’il faudrait estimer d’une façon ou d’une autre pour pouvoir appliquer le
modèle markovien. En pratique, ce sont des modèles plus contraints (avec moins de
paramètres libres) que le modèle général qui sont employés. Un premier modèle,
surtout d’intérêt historique et pédagogique, est le modèle de Jukes et Cantor, avec
un seul paramètre libre : tous les termes non diagonaux de Q sont égaux à r, les
termes diagonaux devenant –3r. Les fréquences d’équilibre de ce modèle sont (¼, ¼,
¼, ¼). Biologiquement, c’est l’hypothèse que toutes les substitutions sont équiprobables, ce qui est très irréaliste, mais a l’avantage de la simplicité.
Le modèle de Kimura à deux paramètres est encore d’usage fréquent. Il vise à
représenter une réalité biologique qui est que les transitions – substitutions entre
deux purines (A G) ou entre deux pyrimidines (C
T) – sont observées plus
fréquemment dans les séquences que les transversions – substitutions entre purine et
pyrimidine. Ainsi, ce modèle admet l’existence de deux taux de substitutions, celui
des transitions et celui des transversions. Q devient :
où b est le taux des transversions et le taux des transitions. En pratique,
a
a b
> , ce
qui modélise un excès de transitions par rapport aux transversions.
Le modèle HKY (Hasegawa, Kishino et Yano) permet d’introduire en plus
n’importe quel vecteur de fréquences d’équilibre :
Q
A
–
b
b
a
b
T
–
a
b
b
a
C
–
b
a
b
b
G
–
=
Q
A
–
T b
C b
G a
A b
T
–
C a
G b
A b
T a
C
–
G b
A a
T b
C b
G
–
=
68
Le modèle markovien et tous les résultats présentés jusqu’ici s’appliquent également aux séquences protéiques en utilisant une matrice de dimension 20.
Q
Pour pouvoir appliquer ce modèle markovien de l’évolution moléculaire, il faut
connaître les valeurs de ses paramètres, les termes non diagonaux de la matrice Q.
Pour les séquences nucléotidiques, ces valeurs sont estimées à partir des jeux de
séquences analysés. Pour les séquences protéiques, la dimension 20 de Q augmente
considérablement le nombre de paramètres. Ceux-ci sont donc estimés de manière
empirique une fois pour toutes à partir d’une vaste compilation de familles de
séquences homologues, puis réutilis
jeu de données.
és pour chaque
6.3.2 Quelques modèles nucléotidiques de Markov
Dans sa forme la plus générale, la matrice Q (figure 6.6) possède douze paramètres
libres qu’il faudrait estimer d’une façon ou d’une autre pour pouvoir appliquer le
modèle markovien. En pratique, ce sont des modèles plus contraints (avec moins de
paramètres libres) que le modèle général qui sont employés. Un premier modèle,
surtout d’intérêt historique et pédagogique, est le modèle de Jukes et Cantor, avec
un seul paramètre libre : tous les termes non diagonaux de Q sont égaux à r, les
termes diagonaux devenant –3r. Les fréquences d’équilibre de ce modèle sont (¼, ¼,
¼, ¼). Biologiquement, c’est l’hypothèse que toutes les substitutions sont équiprobables, ce qui est très irréaliste, mais a l’avantage de la simplicité.
Le modèle de Kimura à deux paramètres est encore d’usage fréquent. Il vise à
représenter une réalité biologique qui est que les transitions – substitutions entre
deux purines (A G) ou entre deux pyrimidines (C
T) – sont observées plus
fréquemment dans les séquences que les transversions – substitutions entre purine et
pyrimidine. Ainsi, ce modèle admet l’existence de deux taux de substitutions, celui
des transitions et celui des transversions. Q devient :
où b est le taux des transversions et le taux des transitions. En pratique,
a
a b
> , ce
qui modélise un excès de transitions par rapport aux transversions.
Le modèle HKY (Hasegawa, Kishino et Yano) permet d’introduire en plus
n’importe quel vecteur de fréquences d’équilibre :
Q
A
–
b
b
a
b
T
–
a
b
b
a
C
–
b
a
b
b
G
–
=
Q
A
–
T b
C b
G a
A b
T
–
C a
G b
A b
T a
C
–
G b
A a
T b
C b
G
–
=
