© Dunod – Toute reproduction non autorisée est un délit.
129
10.3 • Méthode de recherche des plus proches voisins (NNM)
Lorsque toutes les comparaisons sont effectuées, pour chaque acide aminé de la
séquence à prédire, la conformation retenue est celle qui totalise le plus fort score.
Ainsi, dans l’exemple du tableau 10.9 la prédiction finale serait :
Cette méthode n’a pu être imaginée que parce que les moyens de calculs ont été
disponibles. En effet le nombre de comparaisons à effectuer est important (voir algorithme ci-après).
En cas d’égalité entre les scores, un ordre de préséance décroissant est établi :
C > H > E > T.
L’optimisation des paramètres a conduit à prédire par heptadecapeptide au lieu des
heptapeptides comme initialement. L’algorithme se présente comme une série de
boucles imbriquées.
pour i = 1, M faire (500)
/* parcourir la sequence a predire
{
pour l = 1, nombre_prot (1000)
/*pour toutes les proteines
{
pour j = 1, N(l)-W+1 faire /*parcourir la sequence de la banque
{
Score = 0
/* inItialisation du score
pour k=1, W /*calculer le score pour chaque comparaison
{
Score = Score + SUBS[ Seq(i + k) Seq( j + k,l)]
}
Si Score >= seuil alors
/*un peptide a été trouvé
pour k = 1, W
{
/* incrémenter le score correspondant
confo(i + k) = confo(i + k) + Score
}
}
}
}
}
En prenant les valeurs entre parenthèses comme valeurs moyennes, on obtient
plus de 4 10
9
comparaisons à effectuer (avec une fenêtre de calcul W = 17) et en
prenant une longueur moyenne de séquence égale à 500). Des implémentations
basées sur une classification préalable des peptides de la base de données permettent
d’améliorer la rapidité de l’algorithme.
Cette méthode a présenté une
5 % de qualité de prédicaugmentation immédiate de
tion par rapport aux méthodes statistiques. Elle présente l’avantage d’être sensible à
la présence de protéines homologues dans la base de données ce qui fait que sa qualité
a tendance à augmenter avec la taille de la base (tant qu’on apporte plus de signal que
de bruit). La méthode SIMPA est une version améliorée de l’algorithme de base décrit
au paragraphe précédent. La matrice de similitude utilisée est BLOSUM62, la fenêtre
A
V
K
L
M
S
T
Scores
13
22
22
22
13
13
13
Prédiction finale
H
H
H
H
E
E
C
Précédent

- 141/216

Suivant