32
rithmes de base ont donné à l’IA ses premières réalisations de niveau champion du monde au XXe
siècle (backgammon et jeu de dames).
Les avancées récentes reposent essentiellement sur deux approches: les bandits manchots et leurs extensions séquentielles (Monte-Carlo Tree Search, MCTS) d’une part, et l’apprentissage profond
d’autre part.
- Les bandits manchots et MCTS sont un domaine d’excellence en France ; ils sont un élément crucial
pour le business model du Web : l’optimisation de l’affichage des publicités sur les pages Web
draine un marché considérable et fait l’objet de nombreuses start-up.
- L’apprentissage profond a obtenu en RL des réalisations impressionnantes aux jeux d’Atari (niveau
humain) et de Go (niveau champion du monde et au-delà ; les avancées dans le domaine du Go sont
possibles par l’hybridation des MCTS et des réseaux profonds). Ces resultats reposent sur
l’entrainement de réseaux neuronaux profonds à partir de données et d’expérimentations massives,
les archives des parties jouées par des humains et les millions de parties jouées contre soi-même ou
d’autres IA.
Les domaines d’application où ces succès sont transposables comprennent (entre autres) les politiques
d’énergie optimale et la robotique, et plus généralement les domaines qui disposent d’un simulateur
assez fiable (et/ou d’un robot assez robuste) pour créer les données massives nécessaires.
Enjeux actuels. Du point de vue théorique, les garanties cherchées sont très exigeantes : on est en contexte adversarial et il suffit souvent d’une erreur pour perdre la partie. Des objectifs plus complexes
(compromis gain/risque) peuvent être atteints sous des conditions restrictives.
Une autre difficulté dans un contexte d’application réelle consiste à spécifier l’objectif : il ne s’agit
plus de ``gagner la partie'' mais de (par ex.) ``doter un robot compagnon d’un comportement amical/approprié'', ou ``d’identifier les meilleures manoeuvres de sécurité pour un réseau électrique de très
grande taille''.
Apprentissage profond
Contexte historique. L’apprentissage profond (à partir de 2005) n’est pas un simple revival des réseaux neuronaux : à coté des différences quantitatives (plusieurs ordres de grandeur en taille des données, en taille du modèle, et en temps calcul), une différence qualitative concerne l’importance de la
représentation. La création d’une bonne représentation n’est plus une étape hors champ, laissée à la
créativité des étudiants ou des experts du domaine, mais une étape centrale de l’apprentissage automatique (apprentissage « end-to-end » dans le cadre supervisé).
Un aspect essentiel des réseaux profonds est qu’ils définissent un bon espace de recherche (ils sont
capables d’émuler tout programme) dans lequel il est possible de progresser (au sens d’un critère à
optimiser et en fonction des données disponibles). Par contre, l’optimisation offre peu ou pas de garanties (optimisation non convexe, qualité des optima locaux, ajustement des hyper-paramètres) et demande des monceaux de données (des millions d’exemples; pour optimiser les millions de poids du
réseau).
Les réseaux profonds peuvent émuler la coopération et la compétition de différents ”joueurs” : par
exemple un joueur génératif (capable de générer de nouvelles données) et un joueur adversarial (cherchant à distinguer les données générées des données initiales). La co-évolution de tels joueurs (réseau
Generative Adversarial Network) implémente un test de Turing : il cree de nouvelles données qu’on
ne sait plus distinguer des initiales. En pratique, les GANs sont à la racine de réalisations impressionnantes, mais difficiles à reproduire et d’apprentissage instable.
Transversalité. L’apprentissage profond a rapidement envahi l’ensemble des domaines de
l’apprentissage . . . et au-delà.
- L’apprentissage supervisé, commen mentionné plus haut ;
- L’apprentissage non-supervisé, pour lequel la définition automatique de la représentation représente
une avancée majeure ;
- L’apprentissage par renforcement, dans lequel l’apprentissage profond permet de capitaliser sur de
très nombreuses réalisations du processus (voir AlphaGo).
Précédent

- 34/350

Suivant