Les World Models sont apparus en 2018 comme une approche plus saine en Deep Reinforcement Learning, et ont ensuite été fortement popularisés par des acteurs comme Yann Lecun. Entre apprentissage des dynamiques latentes d’un système et exploitation pour des modèles génératifs ou le contrôle d’un agent (au sens DRL), ce domaine annonce la prochaine révolution de l’Intelligence Artificielle avec déjà de nombreuses applications. Cette formation repart des fondamentaux (VAE, model based reinforcement) pour introduire les travaux fondamentaux, les différentes modélisations, jusqu’à présenter les applications existantes, les opportunités futures et les limites connues à date de ces outils.

Moyens techniques

Support de cours projeté pendant la formation et transmis à l’ensemble des stagiaires à l’issue de la formation; cas et exemples pratiques choisis selon les domaines d’intérêt des stagiaires

Suivi de l’exécution

Emargement demandé chaque demie-journée à tous les stagiaires Évaluation : Questionnaire d’évaluation des acquis à l’issue de la formation

Appréciation des résultats

Questionnaire de satisfaction à l’issue de la formation

Objectifs pédagogiques

JOUR 1 – Du Deep Reinforcement Learning au World Model

 
 

1.1 – Introduction au Deep Reinforcement Learning

* Deep Reinforcement Learning : principes fondateurs, comparaison aux autres apprentissages
* Notions fondamentales : Markov Decision Process, somme des récompenses, policy, value function, équation de Bellman
* Approches classiques non IA : exemples d’algorithmes macros et limites fortes
* Temporal Difference Learning & Monte Carlo Policy : présentation et comparaison

 
 

1.2 – Applications classique Deep Reinforcement Learning : Q Learning & Policy Gradients

* Présentation de l’approche Q Learning globale. Premiers travaux en Deep Learning (Playing Atari with Deep Reinforcement Learning, Mnih et al, 2013)
* Evolution rapide du Q Learning jusqu’aux travaux de Deepmind (Rainbow, Deepmind)
* Présentation de l’approche Policy Gradient globale, approche Actor Critic. Comparaison au Q Learning
* Exemples d’approche Policy Gradient (PPO, SAC), vision globale. Limites fortes en apprentissage et en application.

 
 

1.3 – Recurrent World Models : le travail originel

* Rappel de l’architecture VAE (Kingma et al, 2013) : apprentissage d’un espace latent dont la distribution est contrôlée
* Présentation détaillée des Recurrent World Models : présentation des trois parties (VAE, MD-RNN, Controler). Intérêt d’un apprentissage découplé. Présentation des résultats. Apprentissage face au modèle appris uniquement.
* Le World Model comme modélisation interne du système IA : distinction model-free / model-based.
* Illustration : Imagination-Augmented Agents for Deep Reinforcement Learning, Weber et al, 2017

 
 

1.4 – Autres approches récurrentes : les modèles « Dreamer »

* Travail initial : « Dream to Control: Learning Behaviors by Latent Imagination ». Présentation détaillée de l’approche
* Adaptation aux représentations discrètes : DreamerV2, « Mastering Atari with Discrete World Models »
* Généralisation à de nombreuses tâches : « DreamerV3 : Mastering Diverse Domains through World Models ». Présentation détaillée de l’approche


 
 
 
 

JOUR 2 – World Models avancés, applications & limites

2.1 – Approches basées sur l’architecture Transformer

* Impact de l’architecture Transformer (Vaswani et al) sur les approches World Model. Analyse détaillée d’IRIS (« Transformers are Sample-Efficient World Models »), comparaison aux approches récurrentes.
* Evolutions vers Δ-IRIS (« Efficient World Models with Context-Aware Tokenization »). Evolutions techniques en architecture et en entraînement.
* Vision haut niveau des approches de Google GENIE : analyse de la première publication, réflexions sur les communications publiques des versions 2 et 3 de GENIE


 
 

2.2 – Approches structurées ou basées sur la physique

* Physics Informed Neural Networks ? Quelles possibilités pour coupler règles physiques et architectures Deep Learning ? Quelles limites.
* Causal Representation Learning : parcours du domaine et de ses limites fortes. Rupture entre apprentissage stochastique efficace et apprentissage causal limité.

 
 

2.3 – World Models & LLMs

* Un LLM est-il un World Model ? Parcours des travaux de représentation interne d’un agent LLM en évolution dans un environnement
* Premiers travaux de rapprochement : « Reasoning with Language Model is Planning with World Model ». Limites du LLM et gestion d’un planning pour modélisation World Model
* Contrôle d’un World Model par le langage : « Semantic World Models » & « Cosmos World Foundation Model Platform for Physical AI ». Résultats obtenus, notamment en contrôle robotique.


 
 

2.4 – du VAE à JEPA : Focus

* Focus sur JEPA depuis la présentation du VAE. Détails de la modélisation et de l’apprentissage. Applications possibles.
* Evolutions : V-JEPA & V-JEPA2


 
 

2.5 – Revue des applications et limites des World Models

* Robotique : simulation d’actions avant exécutions, sim2real
* Génération : génération de vidéos/jeux contrôlées
* Agents multi-modaux et World Models
* Modélisation d’un problème spécifique scientifique
* Business / finance

Technologies abordées

Architectures fondamentales : CNN, Transformer, VAE
Approches fondamentales DRL : Q-Learning (Rainbow)/ Policy Gradient (PPO, SAC)
Approches de renforcement complexes (model based/world models)
Famille de modèles JEPA

Compétences visées

Disposer d’une connaissance à date des principales architectures utilisées.

Connaître les éléments d’analyse et de critique des implémentations possibles de ces architectures.

Maîtriser les conditions de mise en oeuvre de ces implémentations.