Chapitre 4 • Recherche dans les banques
34
Dans l’alignement 2, il s’agit d’un vrai alignement (avec possibilité d’insertions et
de délétions appelées aussi gaps). Le pourcentage de similitude Si% est la même
notion que l’identité mais en utilisant une matrice de substitution. Il ressort que le
Si% ≥ Id%.
Comment savoir si le pourcentage obtenu est fort et significatif ou pas ? Pour
répondre, il faut :
• définir la façon dont on calcule le score
rtions-délétions par
(pénalité sur les inse
exemple) ;
• faire un choix sur l’alignement (ici nous considérons le deuxième alignement
comme celui de référence, son score est Sr = 40) ;
• prendre en compte la longueur des séquences ;
• savoir si le score mesuré est significatif.
Une difficulté est que le score Sr obtenu n’est comparable que pour un système de
score donné. Il est possible de normaliser le score Sr en S bit par :
où et K sont des paramètres estimés en fonction des matrices/pénalités et composition en acides aminés des séquences pour un espace de recherche donné. On peut
considérer Sbit comme un score normalisé qui permet de comparer des scores
obtenus sur des séquences différentes.
Pour savoir si un score Sr (ou S bit ) est significatif, il suffit de brasser les séquences
(shuffling) comme dans la figure 4.1. Dans cet exemple, seule la séquence 1 est
générée aléatoirement tout en respectant la composition en acides aminés. Par
simplification, le score est ici simplement le nombre d’identités. Après avoir refait
les alignements, les scores sont calculés.
Le pourcentage maximal d’identité reflète la différence de composition en acides
aminés. Pour s’en convaincre, il suffit de ranger ensemble toutes les lettres identiques. Il ressort que lors d’un tirage, le score obtenu par hasard peut être supérieur à celui obtenu pour les vraies séquences.
La moyenne des scores obtenus après brassage représente le bruit moyen Sm pour
ces séquences.
La position des acides aminés dans la séquence 1 est tirée au sort. Ici quatre
tirages successifs sont effectués. Les séquences aléatoires respectent la composition
en acides aminés des séquences initiales.
On peut définir alors le Z-score :
( est l’écart-type de la distribution des scores).
Ce Z-score permet de comparer des paires de séquences de longueur et de compositions différentes.
S bit
Sr
K
ln
–
2
ln
------------------------ -
=
Z
Sr Sm
–
------------------- -
=
34
Dans l’alignement 2, il s’agit d’un vrai alignement (avec possibilité d’insertions et
de délétions appelées aussi gaps). Le pourcentage de similitude Si% est la même
notion que l’identité mais en utilisant une matrice de substitution. Il ressort que le
Si% ≥ Id%.
Comment savoir si le pourcentage obtenu est fort et significatif ou pas ? Pour
répondre, il faut :
• définir la façon dont on calcule le score
rtions-délétions par
(pénalité sur les inse
exemple) ;
• faire un choix sur l’alignement (ici nous considérons le deuxième alignement
comme celui de référence, son score est Sr = 40) ;
• prendre en compte la longueur des séquences ;
• savoir si le score mesuré est significatif.
Une difficulté est que le score Sr obtenu n’est comparable que pour un système de
score donné. Il est possible de normaliser le score Sr en S bit par :
où et K sont des paramètres estimés en fonction des matrices/pénalités et composition en acides aminés des séquences pour un espace de recherche donné. On peut
considérer Sbit comme un score normalisé qui permet de comparer des scores
obtenus sur des séquences différentes.
Pour savoir si un score Sr (ou S bit ) est significatif, il suffit de brasser les séquences
(shuffling) comme dans la figure 4.1. Dans cet exemple, seule la séquence 1 est
générée aléatoirement tout en respectant la composition en acides aminés. Par
simplification, le score est ici simplement le nombre d’identités. Après avoir refait
les alignements, les scores sont calculés.
Le pourcentage maximal d’identité reflète la différence de composition en acides
aminés. Pour s’en convaincre, il suffit de ranger ensemble toutes les lettres identiques. Il ressort que lors d’un tirage, le score obtenu par hasard peut être supérieur à celui obtenu pour les vraies séquences.
La moyenne des scores obtenus après brassage représente le bruit moyen Sm pour
ces séquences.
La position des acides aminés dans la séquence 1 est tirée au sort. Ici quatre
tirages successifs sont effectués. Les séquences aléatoires respectent la composition
en acides aminés des séquences initiales.
On peut définir alors le Z-score :
( est l’écart-type de la distribution des scores).
Ce Z-score permet de comparer des paires de séquences de longueur et de compositions différentes.
S bit
Sr
K
ln
–
2
ln
------------------------ -
=
Z
Sr Sm
–
------------------- -
=
