Chapitre 10 • Prédictions de structures secondaires
134
• l’utilisation en production sur des nouvelles entrées afin de donner des sorties
pertinentes.
Dans le cas de la prédiction de structure secondaire, le jeu de données est divisé en
deux lots, un lot d’appr
e de vérifier que la qualité des
entissage et un lot test. Il import
prédictions est comparable sur le lot test par rapport au lot d’apprentissage avant de
mettre le réseau en production. Tout écart trop important traduit un déficit d’apprentissage
(si la taille du lot test n’est pas suffisante ou si la complexité est importante) ou bien
un « sur-apprentissage ». La qualité de prédiction pour la méthode PHD développée
par Rost et Sander en 1993 est de l’ordre de 72 % pour trois états prédits. Une évolution
des réseaux de neurones a été de les coupler à PSI-BLAST pour donner PSI-PRED
qui obtient une qualité de 81,6 %. Si les méthodes de réseau de neurones présentent
les avantages d’être très performants et rapides en utilisation, la croissance des banques
de données nécessite un réapprentissage régulier qui peut être assez coûteux pour calibrer à nouveau tous les poids. Surtout, un inconvénient majeur est que la compréhension des mécanismes d’acquisition de la structure secondaire n’est pas améliorée car
le réseau fonctionne comme une « boîte noire ».
10.7 AUTRES MÉTHODES
10.7.1 Méthode statistique discriminante (DSC)
Cette méthode prend en compte différents aspects de la prédiction de structure
secondaire pour les combiner en un vecteur de dix attributs. La prédiction de structure
secondaire est réalisée à partir de ces vecteurs en utilisant une discrimination linéaire
dont les résultats sont filtrés par un ensemble de règles. La qualité est de 70,1 %.
10.7.2 Méthode neuronale (PREDATOR)
Cette méthode tente d’inclure des informations de structure en prédisant les résidus
potentiellement liés par une liaison hydrogène à travers des statistiques d’occurrences des résidus dans différents types de ponts et des paires (i,i+4) de résidus
dans les hélices . La qualité de prédiction est de 68 %. En utilisant des séquences
similaires, le pourcentage de qualité est porté à 75 %.
10.7.3 Méthode hiérarchisée réseaux de neurones (HNN)
La méthode HNN (Hierarchical Neural Network) utilise deux réseaux de neurones
pour la prédiction. L’amélioration résulte principalement de la mise en œuvre
d’architectures mieux adaptées à la tâche, faisant en particulier intervenir des
connexions récurrentes, ce qui permet la prise en compte d’un contexte plus important dans la prédiction, tout en diminuant le nombre de paramètres d’un ordre de
grandeur. Elle résulte également de l’introduction explicite des paramètres physicochimiques parmi les prédicteurs utilisés par le second réseau (structure-to-structure
network). La qualité de prédiction est 65,4 % en utilisant la seule séquence à prédire.
134
• l’utilisation en production sur des nouvelles entrées afin de donner des sorties
pertinentes.
Dans le cas de la prédiction de structure secondaire, le jeu de données est divisé en
deux lots, un lot d’appr
e de vérifier que la qualité des
entissage et un lot test. Il import
prédictions est comparable sur le lot test par rapport au lot d’apprentissage avant de
mettre le réseau en production. Tout écart trop important traduit un déficit d’apprentissage
(si la taille du lot test n’est pas suffisante ou si la complexité est importante) ou bien
un « sur-apprentissage ». La qualité de prédiction pour la méthode PHD développée
par Rost et Sander en 1993 est de l’ordre de 72 % pour trois états prédits. Une évolution
des réseaux de neurones a été de les coupler à PSI-BLAST pour donner PSI-PRED
qui obtient une qualité de 81,6 %. Si les méthodes de réseau de neurones présentent
les avantages d’être très performants et rapides en utilisation, la croissance des banques
de données nécessite un réapprentissage régulier qui peut être assez coûteux pour calibrer à nouveau tous les poids. Surtout, un inconvénient majeur est que la compréhension des mécanismes d’acquisition de la structure secondaire n’est pas améliorée car
le réseau fonctionne comme une « boîte noire ».
10.7 AUTRES MÉTHODES
10.7.1 Méthode statistique discriminante (DSC)
Cette méthode prend en compte différents aspects de la prédiction de structure
secondaire pour les combiner en un vecteur de dix attributs. La prédiction de structure
secondaire est réalisée à partir de ces vecteurs en utilisant une discrimination linéaire
dont les résultats sont filtrés par un ensemble de règles. La qualité est de 70,1 %.
10.7.2 Méthode neuronale (PREDATOR)
Cette méthode tente d’inclure des informations de structure en prédisant les résidus
potentiellement liés par une liaison hydrogène à travers des statistiques d’occurrences des résidus dans différents types de ponts et des paires (i,i+4) de résidus
dans les hélices . La qualité de prédiction est de 68 %. En utilisant des séquences
similaires, le pourcentage de qualité est porté à 75 %.
10.7.3 Méthode hiérarchisée réseaux de neurones (HNN)
La méthode HNN (Hierarchical Neural Network) utilise deux réseaux de neurones
pour la prédiction. L’amélioration résulte principalement de la mise en œuvre
d’architectures mieux adaptées à la tâche, faisant en particulier intervenir des
connexions récurrentes, ce qui permet la prise en compte d’un contexte plus important dans la prédiction, tout en diminuant le nombre de paramètres d’un ordre de
grandeur. Elle résulte également de l’introduction explicite des paramètres physicochimiques parmi les prédicteurs utilisés par le second réseau (structure-to-structure
network). La qualité de prédiction est 65,4 % en utilisant la seule séquence à prédire.
