© Dunod – Toute reproduction non autorisée est un délit.
101
8.2 • Détection de signatures de séquence (PROSITE)
ID des séquences avec la lettre T pour vrai positif, N pour faux négatif (séquence
porteuse de la fonction mais pas détectée, F pour faux positif (séquence détectée
mais n’ayant pas la fonction). La ligne 3D indique le code PDB des structures 3D
connues. La ligne DO contient la référence de la documentation correspondante.
//
ID
6PGD; PATTERN.
AC
PS00461;
DT
MAY-1991 (CREATED); DEC-2004 (DATA UPDATE); JAN-2009 (INFO UPDATE).
DE
6-phosphogluconate dehydrogenase signature.
PA
[LIVM]-x-[DG]-x(2)-[GAEHS]-[NQSD]-[KS]-G-[TE]-G-x-W.
NR
/RELEASE=56.8,410518;
NR
/TOTAL=56(56); /POSITIVE=56(56); /UNKNOWN=0(0); /FALSE_POS=0(0);
NR
/FALSE_NEG=0; /PARTIAL=0;
CC
/TAXO-RANGE=??EP ?; /MAX-REPEAT=1;
CC
/VERSION=1;
DR
P38720, 6PGD1_YEAST, T; P80859, 6PGD2_BACSU, T; P53319, 6PGD2_YEAST, T;
DR
P37754, 6PGD9_ECOLX, T; P70718, 6PGD_ACTAC , T; P52207, 6PGD_BACLI , T;
DR
P12013, 6PGD_BACSU , T; P57208, 6PGD_BUCAI , T; Q9ZHD9, 6PGD_BUCAP , T;
DR
Q89AX5, 6PGD_BUCBP , T; Q17761, 6PGD_CAEEL , T; O13287, 6PGD_CANAL , T;
DR
P41570, 6PGD_CERCA , T; Q9PKX7, 6PGD_CHLMU , T; Q9Z8I3, 6PGD_CHLPN , T;
DR
O84066, 6PGD_CHLTR , T; P41581, 6PGD_CITAM , T; P41582, 6PGD_CITDI , T;
DR
P41583, 6PGD_CITFR , T; O60037, 6PGD_CUNEL , T; Q8TA03, 6PGD_DICDI , T;
DR
P41572, 6PGD_DROME , T; P41573, 6PGD_DROSI , T; P00350, 6PGD_ECOLI , T;
DR
P41574, 6PGD_ESCVU , T; Q7VMX4, 6PGD_HAEDU , T; P43774, 6PGD_HAEIN , T;
DR
P52209, 6PGD_HUMAN , T; P41575, 6PGD_KLEPL , T; P41576, 6PGD_KLEPN , T;
DR
P41577, 6PGD_KLETE , T; Q9CHU6, 6PGD_LACLA , T; P96789, 6PGD_LACLM , T;
DR
Q9DCD0, 6PGD_MOUSE , T; P14332, 6PGD_PIG
, T; P85968, 6PGD_RAT
, T;
DR
P14062, 6PGD_SALTY , T; P78812, 6PGD_SCHPO , T; P00349, 6PGD_SHEEP , T;
DR
P41578, 6PGD_SHIBO , T; P41579, 6PGD_SHIDY , T; P37756, 6PGD_SHIFL , T;
DR
P41580, 6PGD_SHISO , T; Q5HFR2, 6PGD_STAAC , T; Q931R3, 6PGD_STAAM , T;
DR
P63334, 6PGD_STAAN , T; Q6GGI7, 6PGD_STAAR , T; Q6G954, 6PGD_STAAS , T;
DR
P63335, 6PGD_STAAW , T; Q5HP42, 6PGD_STAEQ , T; Q8CP47, 6PGD_STAES , T;
DR
P21577, 6PGD_SYNE7 , T; P52208, 6PGD_SYNY3 , T; O83351, 6PGD_TREPA , T;
DR
P31072, 6PGD_TRYBB , T; P54448, YQEC_BACSU , T;
3D
1PGJ; 1PGN; 1PGO; 1PGP; 1PGQ; 2IYO; 2IYP; 2IZ0; 2IZ1; 2P4Q; 2PGD;
DO
PDOC00390;
//
On peut utiliser le dictionnaire pour identifier les signatures présentes dans une
séquence de protéine afin d’identifier sa fonction. Plusieurs implémentations existent dont une seule est présentée ci-après qui utilise une matrice de substitution
unitaire (voir chapitre 3).
Pour cela, pour chaque signature de longueur L contenue dans le fichier
PROSITE.DAT, une analyse syntaxique de(s) la(es) ligne(s)
effectuée. Pour
PA est
chaque position, une matrice de substitution unitaire (voir chapitre 3, figure 3.12) est
créée qui contient des 1 si la substitution est autorisée et des 0 sinon (figure 8.2).
La séquence est parcourue par segments chevauchants de longueur L. Chaque
segment de la séquence est transformé dans la signature en utilisant les matrices de
substitution correspondant à ch
mation, la somme
aque position. Pour chaque transfor
des scores est calculée. Une occurrence exacte de la signature est trouvée si S = L
(L = 6 pour la signature LVTHNS). Une occurrence avec k erreurs est trouvée si S =
L–k et une occurrence est trouvé avec 

% d’identité si S = L × .
Précédent

- 113/216

Suivant