108
2.1.1.3 L’organisation de challenges : permettre
de se comparer en toute confiance
Les challenges sont des projets pluriannuels qui consistent à proposer un cadre commun de
comparaison des solutions de systèmes. Cette organisation existe déjà dans certains domaines
(recherche opérationnelle
2
, traduction
3
, traitement de documents scannés
4 , repérage de personnes
5
,
négociation
6
, réputation et confiance
7
, robotique
8
, systèmes multi-agents
9 , véhicule autonome
10
, …). Il
est nécessaire de la généralisation à tous les domaines de l’IA en confiant cette mission à un
organisme public garant de l’équité entre l’ensemble des participants : l’évaluateur.
Les challenges consistent à comparer les décisions de systèmes à des références afin d’estimer la
performance, la justesse et la robustesse des systèmes. Les systèmes sont évalués dans les mêmes
conditions pour réaliser une tâche définie par les industriels pour laquelle les équipes de développeurs
proposent des solutions. Les challenges répondent à un plan expérimental précis : un cas d’usage
défini, un cadre expérimental réaliste (hardware in the loop, données, plateformes…), des métriques
adaptées et des facteurs de variation à étudier identifiés.
Les références sont établies selon la nature des tâches, elles peuvent correspondre à des annotations
humaines quand il s’agit d’interprétation, à des mesures physiques sur étalons ou à des actions
attendues dans le cadre de la robotique. En fonction de la maturité des technologies, les cas d’usage
traités (et leurs références) peuvent être fournis par les industriels ou en open data lorsqu’un
organisme public a financé l’obtention des références. Les références peuvent également être
accessibles par simulation, une fois cette dernière validée par des tests réels. Il est de la responsabilité
de l’évaluateur de garantir la pertinence des références.
La métrique de comparaison est une fonction de coût que les développeurs cherchent à optimiser.
C’est cette mesure qui permet de qualifier la capacité de l’IA à réaliser la tâche pour laquelle elle a été
créée. Cette métrique est le critère qui permet de juger de pertinence du système d’IA.
Pour évaluer équitablement et simultanément la fiabilité des différentes IA, les challenges sont
organisés par un tiers de confiance. La synchronie de la campagne est une solution pour garantir
l’équité entre les systèmes d’IA.
Ces challenges peuvent facilement avoir une portée internationale s’ils sont correctement organisés et
pertinents en termes d’application. Ils permettront, non seulement le benchmark des solutions, mais
aussi d’assurer la visibilité et le rayonnement de la France.
2 ROADEF : https://www.roadef.org/roadef-le-challenge
3 TRAD : www.trad-campaigns.org, IWSLT initiative européenne
4 MAURDOR : www.maurdor-campaigns.org, initiative française
5 REPERE : www.defi-repere.fr, initiative française
6 TAC: http://tac.sics.se/page.php?id=1 (Trading Agent Competition), PTAC: http://www.powertac.org/node/4
(Power Trading Agent Competition)
7 ART: http://megatron.iiia.csic.es/art-testbed/ (Agent Reputation and Trust)
8 Robocup: http://www.robocup.org/ , initiative internationale, http://rfia2016.iutauvergne.com/index.php/ia/competition-ia-sur-robots, initiative française,
http://www.enib.fr/~even/BotContest2017.html , initiative française
9 https://multiagentcontest.org/, initiative internationale
10 https://www.udacity.com/self-driving-car, initiative américaine
Précédent

- 110/350

Suivant