62
x mise en place dans les ANR d'un volet spécifique sur les travaux en SHS relatifs à l'IA
x mise en place dans les PIA technologiques relatifs à l'IA d'un volet spécifique sur les impacts
sociétaux.
4.4 Développer les moyens techniques pour la formation en IA
Développer les formations en IA nécessite de mettre à disposition des enseignants et des étudiants les
ressources incontournables du développement de nouveaux systèmes. De plus, ces ressources peuvent
aisément être mutualisées entre les acteurs (recherche, formation, entreprises). Là où les Etats-Unis
comptent des bases de données, gratuites et libres, en langue anglaise, les enseignants/chercheurs ne
disposent que de quelques jeux de données, anciens, et non mutualisés en français. De plus, les
tutoriels et les librairies de calcul accessibles par internet se multiplient et les supports développés en
France bénéficient de trop peu de soutiens pour se développer et proposer des formations pour les
enseignants (Scikit-Learn est un exemple notoire).
Recommandation : Développer une ressource nationale (voire de la francophonie) de données non
agrégées, structurées et labellisées en Français
x Créer une base de données structurées, non agrégées, labellisées, de toutes natures (voix,
images, textes, signaux, vidéos, etc.) pouvant s'appuyer sur les ressources publiques non ou
faiblement exploitées (ex : Base INA, Base enregistrement RadioFrance, Sous titrage de la
télévision publique, Santé) ;
x Placer le développement et la gestion de cette base de données sous l’égide de data.gouv.fr
dans la continuité des travaux d’Etalab ;
x Définir des mécanismes durables pour l’alimenter et structurant des communautés et des
méthodes pérennes de labellisation autour de ces nouvelles ressources ;
x La structuration et la mise à disposition de ces données pourront faire l'objet d'appels au PIA
3 ;
x Elle doit être ouverte gratuitement aux JEI afin d’inciter le développement de startups en IA
en France ;
x Allonger la durée de détention des données personnelles imposée par la CNIL.
Recommandation : Pérenniser les initiatives logicielles open source française en IA bénéficiant à la
recherche et à la formation
En effet, nos initiatives existantes, même les plus reconnues, ont du mal à obtenir des financements
dans le cadre des AAP. Il est donc nécessaire de :
x créer via le PIA, un fond dédié spécifiquement au financement des logiciels open source à
intérêt public pour :
o Consolider les logiciels ayant du succès en finançant le développement des
plateformes sur le modèle de ce qui existe aux Etats-Unis (ex : CodeOcean), où les
logiciels ayant fait leurs preuves ne sont plus vus comme des livrables de fin de
projet, mais des actifs valorisés et entretenus ;
o Favoriser leur dissémination en finançant des évènements de formation (ateliers,
workshops) à travers le réseau des écoles et des universités. Pour faciliter
l’organisation de tels workshops le Center for Data Science (CDS) de l’université
Paris-Saclay a financé le développement d’une plateforme de travail collaboratif
x mise en place dans les ANR d'un volet spécifique sur les travaux en SHS relatifs à l'IA
x mise en place dans les PIA technologiques relatifs à l'IA d'un volet spécifique sur les impacts
sociétaux.
4.4 Développer les moyens techniques pour la formation en IA
Développer les formations en IA nécessite de mettre à disposition des enseignants et des étudiants les
ressources incontournables du développement de nouveaux systèmes. De plus, ces ressources peuvent
aisément être mutualisées entre les acteurs (recherche, formation, entreprises). Là où les Etats-Unis
comptent des bases de données, gratuites et libres, en langue anglaise, les enseignants/chercheurs ne
disposent que de quelques jeux de données, anciens, et non mutualisés en français. De plus, les
tutoriels et les librairies de calcul accessibles par internet se multiplient et les supports développés en
France bénéficient de trop peu de soutiens pour se développer et proposer des formations pour les
enseignants (Scikit-Learn est un exemple notoire).
Recommandation : Développer une ressource nationale (voire de la francophonie) de données non
agrégées, structurées et labellisées en Français
x Créer une base de données structurées, non agrégées, labellisées, de toutes natures (voix,
images, textes, signaux, vidéos, etc.) pouvant s'appuyer sur les ressources publiques non ou
faiblement exploitées (ex : Base INA, Base enregistrement RadioFrance, Sous titrage de la
télévision publique, Santé) ;
x Placer le développement et la gestion de cette base de données sous l’égide de data.gouv.fr
dans la continuité des travaux d’Etalab ;
x Définir des mécanismes durables pour l’alimenter et structurant des communautés et des
méthodes pérennes de labellisation autour de ces nouvelles ressources ;
x La structuration et la mise à disposition de ces données pourront faire l'objet d'appels au PIA
3 ;
x Elle doit être ouverte gratuitement aux JEI afin d’inciter le développement de startups en IA
en France ;
x Allonger la durée de détention des données personnelles imposée par la CNIL.
Recommandation : Pérenniser les initiatives logicielles open source française en IA bénéficiant à la
recherche et à la formation
En effet, nos initiatives existantes, même les plus reconnues, ont du mal à obtenir des financements
dans le cadre des AAP. Il est donc nécessaire de :
x créer via le PIA, un fond dédié spécifiquement au financement des logiciels open source à
intérêt public pour :
o Consolider les logiciels ayant du succès en finançant le développement des
plateformes sur le modèle de ce qui existe aux Etats-Unis (ex : CodeOcean), où les
logiciels ayant fait leurs preuves ne sont plus vus comme des livrables de fin de
projet, mais des actifs valorisés et entretenus ;
o Favoriser leur dissémination en finançant des évènements de formation (ateliers,
workshops) à travers le réseau des écoles et des universités. Pour faciliter
l’organisation de tels workshops le Center for Data Science (CDS) de l’université
Paris-Saclay a financé le développement d’une plateforme de travail collaboratif
