39
connaissances sont formalisées sous forme d’ontologies qui permettent de typer et relier sémantiquement les données du Web pour les interroger de manière plus pertinente et plus efficace. Une ontologie est un vocabulaire structuré de classes et de propriétés définies à l’aide d’un formalisme logique
compréhensible par des humains et traitable par des machines. L’algorithmique à mettre en place pour
répondre à des requêtes posées par le biais d’ontologies repose sur des algorithmes de raisonnement
automatique permettant d’inférer, à partir des connaissances formalisées dans l’ontologie, que des
éléments de réponses trouvées dans les données satisfont bien la requête. Compte tenu de la taille très
importante des données, garantir des temps de réponses raisonnables pour l’évaluation des requêtes est
un problème central au cœur des travaux sur le Web sémantique. Il s’agit de trouver des restrictions
sur l’expressivité du langage de requêtes et du langage d’expression des ontologies permettant de garantir une complexité algorithmique du calcul des réponses qui soit inférieure dans tous les cas à un
polynôme de la taille des données.
Au-delà du Web sémantique, les ontologies servent à lier et intégrer des données multiples et hétérogènes dans de nombreux autres domaines. Elles servent aussi d’interfaces ``intelligentes'' de requêtes
permettant aux utilisateurs d’exprimer des requêtes à un niveau d’abstraction adapté à leurs besoins et
à leurs compétences. La création d’ontologies est un problème difficile souvent abordé dans un mode
semi-automatique : un noyau est d’abord défini manuellement par un expert du domaine concerné par
les données à intégrer et analyser, puis est ensuite enrichi par fouille de données.
Parce qu’il est symbolique, le raisonnement sur des données décrites par des ontologies est transparent
et traçable. Un résultat d’analyse ou une réponse à une requête sont explicables : la logique conduisant
à l'obtention du résultat est explicite, les sources et liens peuvent être remontés, vérifiés et interrogés et
les résultats sont ainsi mieux appréhendés par un utilisateur non informaticien.
Traitement automatique des langues
Le traitement automatique des langues naturelles (TALN) est une discipline de l'informatique et des
sciences du langage qui s'intéresse à la modélisation et l'automatisation des processus cognitifs langagiers, que ce soit la compréhension de messages, la lecture de textes, le dialogue, la traduction, l'acquisition de connaissances à partir de textes, etc.
Le TALN définit des algorithmes, construit des ressources langagières, élabore des outils et des architectures logicielles pour le traitement des langues. Les algorithmes soit s'ancrent sur les données et
relèvent de l'apprentissage automatique - traitement empirique ou statistique de la langue, soit modélisent les processus langagiers - traitement symbolique de la langue.
Les outils et les ressources développées servent soit à assister les humains dans leur travail (correction
orthographique, traduction ou dictée automatique) ou soit pour opérer à une grande échelle inaccessible à l'humain (moteurs de recherche, fouille de textes et analyse de contenus).
L'approche empirique qui a émergé dans les années 1990 est dominante du aux succès qu'elles a engrangés ces dernières années pour des applications grand-public tel que la traduction automatique, la
reconnaissance de la parole ou encore la détection des opinions sur les réseaux sociaux.
La communauté internationale du TALN est importante. Elle est structurée autour de l'ACL (Association for Computational Linguistics) qui organise ses conférences, annuelles : ACL (CORE A*), 1 200
participants et 900 articles soumis en 2016, NAACL (CORE A), EMNLP (CORE A), et bi-annuelle :
COLING (CORE A) 1 200 participants, EACL (CORE A) chapitre européen de ACL, 500 participants, IJCNLP chapitre asiatique (CORE B), 800 participants, etc. La communauté française du
TALN est structurée autour de son association savante, l'ATALA, depuis 1959. L'ATALA organise
deux conférences annuelles, TALN et RECITAL (pour les doctorants) et des journées d'étude. Elle
édite la revue TAL en langue française. Une réflexion pour la structuration scientifique de la communauté sous l'égide de l'INS2I est en cours.
Précédent

- 41/350

Suivant