Chapitre 8 • Recherche de fonctions
108
Pour chaque bloc, les scores sont normalisés au moyen de la valeur contenue dans
le champ 99,5 % (ici 873) et comparée à la valeur du seuil de décision (ici 2 546). Le
calcul est effectué pour tous les segments et pour tous les blocs et les x meilleurs
scores sont ensuite triés selon les scores décroissants. Ainsi, il est possible de détecter des séquences pour lesquelles certains acides aminés n’ont jamais été encore
observés à une position donnée, ce qui constitue une solution évolutive à la constitution de familles de protéines. Il s’agit de la méthodologie la plus efficace pour détecter des similitudes floues dans les banques de séquences. Plusieurs améliorations ont
été apportées comme la gestion des insertions/délétions dans les blocs, la prise en
compte de sous-famille (grâce à la notion de sous-bloc), la gestion des groupes
d’acides aminés (notion de substitution) et l’utilisation de modèles de Markov.
Les chaînes de Markov
Une amélioration notoire consiste à utiliser le formalisme des chaînes de Markov
cachées (Hidden Markov Model) dans lequel la probabilité d’émission d’un état ne
dépend que des m états précédents (pour une chaîne d’ordre m). Un modèle HMM
permet de modéliser une séquence par un ensemble fini de modèles qui alternent
le long de la séquence. Ainsi, la valeur prise par la variable aléatoire d’état à la
position i permet de calculer la probabilité de l’état à la position i+1. Ainsi,
Tableau 8.1 – Constitution du profil.
1
2
3
4
5 . . 30 31 32
34 35 36 37 38 39 40 41 42
33
A 3,8
0
0 2,6
0 . .
0
0
0
0 35,9
0 47,4
0
0 3,8 2,6
0
0
C
0
0
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0
0
0
D
0
0
0 1,3
0 . .
0
0
0
0
0
0
0
0 47,4
0
0
0
0
E 62,8
0
0
35,
9
0 . .
0
0
0
0
0
0
0
0
50
0
0
0
0
F
0
0 25,6 2,6
0 . .
0
0
0
0
0 3,8
0
0
0
0
0
0
0
G
0
0
0 1,3
0 . .
0
10
0
0
0
0
0
0 2,6
0
0
0
0
0
H 1,3
0
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0 5,1
0
I
0 42,3
0
0
0 . . 1,3
0
0
0
0 29,5 44,9 28,2
0 1,3
97,
4 14,1
0
K 1,3 1,3
0
0
0 . .
0
0
10
0
0
0
0
0
0
0
0
0 1,3
0
L
0 2,6 42,3
0
0 . .
0
0
0
0
0 47,4 1,3 7,7
0 50
0 33,3
0
M
0
0 28,2
0
0 . .
0
0
0
0
0
0 5,1 37,2 2,6 1,3
0
0
0
N
0
0
0
0
0 . .
0
0
0
0
0 2,6
0
0
0
0
0 43,6 97,4
P
0 47,4
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0
0
0
Q 10,3
0
0
44,
9
0 . .
0
0
0
0
0
0
0 12,8
0
0
0
0
1,3
R
0
0
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0 2,6
0
S 20,5
0
0
0
0 . .
0
0
0 2,6 7,7
0
0
0
0
0
0
0
0
T
0
0
0
0 98,
7
. . 46,2
0
0 97,4 5,1
0
0
9
0 43,
6
0
0
0
V
0 6,4 3,8 11,
5
1,3 . . 52,6
0
0
0 51,3 16,7 1,3 2,6
0
0
0
0
0
W
0
0
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0
0
0
Y
0
0
0
0
0 . .
0
0
0
0
0
0
0
0
0
0
0
0
1,3
Précédent

- 120/216

Suivant