JOUR 1 – Du Deep Reinforcement Learning au World Model
1.1 – Introduction au Deep Reinforcement Learning
* Deep Reinforcement Learning : principes fondateurs, comparaison aux autres apprentissages
* Notions fondamentales : Markov Decision Process, somme des récompenses, policy, value function, équation de Bellman
* Approches classiques non IA : exemples d’algorithmes macros et limites fortes
* Temporal Difference Learning & Monte Carlo Policy : présentation et comparaison

1.2 – Applications classique Deep Reinforcement Learning : Q Learning & Policy Gradients
* Présentation de l’approche Q Learning globale. Premiers travaux en Deep Learning (Playing Atari with Deep Reinforcement Learning, Mnih et al, 2013)
* Evolution rapide du Q Learning jusqu’aux travaux de Deepmind (Rainbow, Deepmind)
* Présentation de l’approche Policy Gradient globale, approche Actor Critic. Comparaison au Q Learning
* Exemples d’approche Policy Gradient (PPO, SAC), vision globale. Limites fortes en apprentissage et en application.

1.3 – Recurrent World Models : le travail originel
* Rappel de l’architecture VAE (Kingma et al, 2013) : apprentissage d’un espace latent dont la distribution est contrôlée
* Présentation détaillée des Recurrent World Models : présentation des trois parties (VAE, MD-RNN, Controler). Intérêt d’un apprentissage découplé. Présentation des résultats. Apprentissage face au modèle appris uniquement.
* Le World Model comme modélisation interne du système IA : distinction model-free / model-based.
* Illustration : Imagination-Augmented Agents for Deep Reinforcement Learning, Weber et al, 2017

1.4 – Autres approches récurrentes : les modèles « Dreamer »
* Travail initial : « Dream to Control: Learning Behaviors by Latent Imagination ». Présentation détaillée de l’approche
* Adaptation aux représentations discrètes : DreamerV2, « Mastering Atari with Discrete World Models »
* Généralisation à de nombreuses tâches : « DreamerV3 : Mastering Diverse Domains through World Models ». Présentation détaillée de l’approche

JOUR 2 – World Models avancés, applications & limites
2.1 – Approches basées sur l’architecture Transformer
* Impact de l’architecture Transformer (Vaswani et al) sur les approches World Model. Analyse détaillée d’IRIS (« Transformers are Sample-Efficient World Models »), comparaison aux approches récurrentes.
* Evolutions vers Δ-IRIS (« Efficient World Models with Context-Aware Tokenization »). Evolutions techniques en architecture et en entraînement.
* Vision haut niveau des approches de Google GENIE : analyse de la première publication, réflexions sur les communications publiques des versions 2 et 3 de GENIE

2.2 – Approches structurées ou basées sur la physique
* Physics Informed Neural Networks ? Quelles possibilités pour coupler règles physiques et architectures Deep Learning ? Quelles limites.
* Causal Representation Learning : parcours du domaine et de ses limites fortes. Rupture entre apprentissage stochastique efficace et apprentissage causal limité.

2.3 – World Models & LLMs
* Un LLM est-il un World Model ? Parcours des travaux de représentation interne d’un agent LLM en évolution dans un environnement
* Premiers travaux de rapprochement : « Reasoning with Language Model is Planning with World Model ». Limites du LLM et gestion d’un planning pour modélisation World Model
* Contrôle d’un World Model par le langage : « Semantic World Models » & « Cosmos World Foundation Model Platform for Physical AI ». Résultats obtenus, notamment en contrôle robotique.

2.4 – du VAE à JEPA : Focus
* Focus sur JEPA depuis la présentation du VAE. Détails de la modélisation et de l’apprentissage. Applications possibles.
* Evolutions : V-JEPA & V-JEPA2

2.5 – Revue des applications et limites des World Models
* Robotique : simulation d’actions avant exécutions, sim2real
* Génération : génération de vidéos/jeux contrôlées
* Agents multi-modaux et World Models
* Modélisation d’un problème spécifique scientifique
* Business / finance