Le vocabulaire médical, les ressources terminologiques, le codage de l’information en santé
31
2.7 L’alignement de terminologies
2.7.1 Méthodes de mise en correspondance de terminologies
Comme détaillé dans les sections précédentes, il existe autant de terminologies, de classifications, de thesaurus et de vocabulaires que d’applications
en santé. Pour assurer une interopérabilité sémantique entre ces différentes
ressources terminologiques, il est possible de les mettre en correspondance en
appliquant deux méthodes principales : une fondée sur des propriétés lexicales
des libellés des termes, l’autre fondée sur les propriétés structurelles des termes.
Cette interopérabilité est complexe, car la plupart des terminologies médicales
existantes diffèrent entre elles, que ce soit dans leurs représentations (base de
données terminologiques, classifications, logique de description, etc.) ou dans
leur contexte d’utilisation (domaine clinique pour SNOMED, base de données
bibliographiques pour MeSH, statistique et épidémiologique pour CIM10, etc.).
La mise en correspondance simple des libellés
La méthode de mise en correspondance la plus simple consiste à exploiter des
techniques fondées sur les chaînes de caractères i.e. les libellés des termes sont
considérés comme des suites de caractères. Parmi ces méthodes, on peut citer
les plus connues : distances de Hamming, de Jaccard, de Dice, de Levenshtein,
etc. La distance est calculée entre deux termes provenant de deux terminologies
différentes. Si la distance est de 0, la correspondance est exacte.
Les outils de TAL (Traitement Automatique de la Langue) peuvent compléter
cette approche en considérant les libellés des termes comme une suite de mots
dans un langage naturel. Cela permet notamment de mettre en correspondance
des termes et leur pluriel ou leur adjectif dans une autre terminologie (tableau V).
Tableau V – Exemples de mises en correspondance.
Mise en correspondance exacte
La notion SNOMED « Glycogénose de type ii » est mise en correspondance exacte avec le
descripteur MeSH « Glycogénose de type II ». En effet, « Glycogénose de type ii » est un
synonyme de « Glycogénose de type II » dans le thésaurus MeSH.
Mise en correspondance par combinaison
Le terme Orphanet « Embryopathie diabétique » est mis en correspondance avec deux
termes MeSH : « Diabète » et « Maladies fœtales ». En effet, après l’utilisation de méthodes
de traitement automatique de la langue, « diabétique » est mis en correspondance avec le
terme MeSH « Diabète ». En revanche, « Embryopathie » est un synonyme de « Maladies
fœtales » dans le MeSH, ce qui représente une correspondance exacte.
La mise en correspondance structurelle
Dans cette méthode, les propriétés structurelles des terminologies – relations
« broader/narrower » i.e. « générique/spécifique » – sont exploitées pour établir
des correspondances possibles. Les mesures de similarités sont donc fondées
31
2.7 L’alignement de terminologies
2.7.1 Méthodes de mise en correspondance de terminologies
Comme détaillé dans les sections précédentes, il existe autant de terminologies, de classifications, de thesaurus et de vocabulaires que d’applications
en santé. Pour assurer une interopérabilité sémantique entre ces différentes
ressources terminologiques, il est possible de les mettre en correspondance en
appliquant deux méthodes principales : une fondée sur des propriétés lexicales
des libellés des termes, l’autre fondée sur les propriétés structurelles des termes.
Cette interopérabilité est complexe, car la plupart des terminologies médicales
existantes diffèrent entre elles, que ce soit dans leurs représentations (base de
données terminologiques, classifications, logique de description, etc.) ou dans
leur contexte d’utilisation (domaine clinique pour SNOMED, base de données
bibliographiques pour MeSH, statistique et épidémiologique pour CIM10, etc.).
La mise en correspondance simple des libellés
La méthode de mise en correspondance la plus simple consiste à exploiter des
techniques fondées sur les chaînes de caractères i.e. les libellés des termes sont
considérés comme des suites de caractères. Parmi ces méthodes, on peut citer
les plus connues : distances de Hamming, de Jaccard, de Dice, de Levenshtein,
etc. La distance est calculée entre deux termes provenant de deux terminologies
différentes. Si la distance est de 0, la correspondance est exacte.
Les outils de TAL (Traitement Automatique de la Langue) peuvent compléter
cette approche en considérant les libellés des termes comme une suite de mots
dans un langage naturel. Cela permet notamment de mettre en correspondance
des termes et leur pluriel ou leur adjectif dans une autre terminologie (tableau V).
Tableau V – Exemples de mises en correspondance.
Mise en correspondance exacte
La notion SNOMED « Glycogénose de type ii » est mise en correspondance exacte avec le
descripteur MeSH « Glycogénose de type II ». En effet, « Glycogénose de type ii » est un
synonyme de « Glycogénose de type II » dans le thésaurus MeSH.
Mise en correspondance par combinaison
Le terme Orphanet « Embryopathie diabétique » est mis en correspondance avec deux
termes MeSH : « Diabète » et « Maladies fœtales ». En effet, après l’utilisation de méthodes
de traitement automatique de la langue, « diabétique » est mis en correspondance avec le
terme MeSH « Diabète ». En revanche, « Embryopathie » est un synonyme de « Maladies
fœtales » dans le MeSH, ce qui représente une correspondance exacte.
La mise en correspondance structurelle
Dans cette méthode, les propriétés structurelles des terminologies – relations
« broader/narrower » i.e. « générique/spécifique » – sont exploitées pour établir
des correspondances possibles. Les mesures de similarités sont donc fondées
