Les modèles de diffusion se sont imposés comme une architecture incontournable dans de nombreux domaines (image, audio, renforcement, langage), notamment par leur forte généralisation. Cette formation permet de comprendre ces modèles, leurs spécificités et leurs applications. Elle parcourt les travaux et modélisations fondamentales sorties depuis 2019 et les intègre dans une compréhension globale simplifiée. Elle présente ensuite les différentes applications, pour finir sur la compréhension à date de la communauté scientifique pour expliquer la forte efficacité de ces modèles.

Moyens techniques

Support de cours projeté pendant la formation et transmis à l’ensemble des stagiaires à l’issue de la formation; Publications scientifiques/Benchmarks/Liens github citées et liens communiqués; Etudes de cas avec choix en début de formation selon les domaines d’intérêt des stagiaires

Suivi de l’exécution

Emargement demandé chaque demie-journée à tous les stagiaires Évaluation : Questionnaire d’évaluation des acquis à l’issue de la formation

Appréciation des résultats

Questionnaire de satisfaction à l’issue de la formation

Objectifs pédagogiques

 

JOUR 1 – Théories et optimisations des modèles de diffusion

 

1.1 – Bases des Modèles de diffusion

* Rappels des approches génératives précédentes : Generative Adversarial Network (GAN) & Variational Autoencoders (VAE)
* Premiers travaux (Sohl-Dickstein, 2025) de diffusion. Mapping d’une distribution cible à une distribution contrôlée
* Apprendre les gradients d’une distribution ? Modélisation plus efficace d’un modèle génératif.


 
 

1.2 – Travaux fondateurs en diffusion

* Approche fondamentale de Ho et al (2020) : modélisation des forward/backward processes pour entraînement du modèle génératif. Modélisation par gaussiennes, loss function, et réécriture comme un processus de débruitage.
* Approche fondamentale de Song et al (2021) : rapprochement entre débruitage et « score matching ». Rappels fondamentaux sur équations différentielles ordinaire et stochastique, pour modélisation de la diffusion.
* Analyse des variantes « Variance Exploding » (VE) et « Variance Preserving » (VP) de la diffusion.
* Explication du « Probability Flow ODE » comme d’une solution de l’approche générale. Intérêts forts de cette approche (modélisation de vecteurs latents)
* Présentation des « Denoising Diffusion Implicit Models » (DDIM) : approche non markovienne et meilleure approximation des solutions cherchées
* Utilisation de vecteurs latents dans la diffusion : approche de Rombach et al (Stable Diffusion). Séparation des problématiques entre encoding des images et diffusion. Axes de contrôle du modèle par injection de conditions. Parcours des applications.


 
 

1.3 – Meilleure compréhension et modélisation

* Revue des travaux de Karras et al (NVIDIA, 2022) sur l’espace de conception des modèles de diffusion. Parcours des analyses proposées
* Ré-écriture de la diffusion de Karras et al : revue des approches existantes (VE/VP/DDIM). Séparation des problèmes et gains observés en apprentissage.
* Revue rapide de la ré-écriture des « Variational Diffusion Models » (Kingma, 2021). Présentation de la diffusion comme d’une extension du VAE classique.


 
 

1.4 – Optimisation des modèles de diffusion

* Mise en évidence de la lourdeur naturelle d’un modèle de diffusion à l’inférence.
* Présentation de la distillation pour un modèle de diffusion. Approche itérative de division du nombre de « steps » dans la génération. Ecriture des objectifs sous une vision de rapport signal sur bruit. Limites de l’approche et résultats obtenus.
* Présentation des « Consistency Models » (CM). Enjeux de génération rapide via la consistance le long du « Probability Flow ». Comparaison des approches (distillation d’un modèle classique ou entraînement direct). Applications aux problèmes inverses
* Multistep Consistency Models : approche intermédiaire entre CM et modèle de diffusion. Optimisations obtenues et limites d’application.


 
 
 
 

JOUR 2 – Applications et compréhension des modèles de diffusion

 

2.1 – Applications des modèles de diffusion

* Modèles de diffusion et Large Language Models ? Présentation des difficultés fortes d’application (espace discret) et des intérêts forts (génération one-shot et non pas auto-régressive). Analyse des solutions trouvées en littérature scientifique (notamment : Large Language Diffusion Models). Présentation de Gemma Diffusion (Google). Perspectives d’évolution du paysage LLM/Agentic sur l’année à venir.

* Modèles de diffusion et image ou vidéo : présentation des applications au-delà du modèle génératif. Approches de problèmes inverses génériques et capacité d’adaptations à un problème spécifique. Utilisation des modèles de diffusion en détection d’anomalie : enjeux et limites connues de l’approche. Présentation des exploitations en segmentation/estimation de profondeur comme de problèmes de contrôle. Détail des approches Low Rank (LoRA) et ControlNet.

* Modèles de diffusion et contrôle robotique : focus sur l’introduction de ces modèles en contrôle via les Diffusion Policies. Intérêt d’une généralisation renforcée et efficacité en « Imitation Learning »


 
 

2.2 – Que se passe-t-il dans un modèle de diffusion ?

* Modèles de diffusion & inversion de modèles : exemples de génération d’éléments du dataset à partir du modèle. Point sur la sécurité des modèles de diffusion.

* Pourquoi un modèle de diffusion généralise-t-il aussi bien ? Revue de travaux et de compréhension, avec les « Geometry-Adaptive Harmonic Representations » (généralisation forte sur une architecture convolutive), l’adaptation aux architectures Transformer, et les travaux récents sur l’apprentissage de biais forts depuis le dataset.

* « Culture générale des modèles de diffusion » : analyse de la « créativité » d’un modèle (travaux de Kamb et al, 2025) et liens avec la physique en compréhension des dynamiques de la diffusion.


 
 

Technologies abordées

Architectures fondamentales : CNN, Transformer, VAE.
Bases diffusion : Score Matching/Denoising, DDIM, EDM
Architectures avancées : Consitency Models, Distillation
Frameworks technologiques supportant la formation : CUDA, Pytorch, et implémentations open-source des principaux projets.

Compétences visées

Disposer d’une connaissance à date des principales architectures utilisées.

Connaître les éléments d’analyse et de critique des implémentations possibles de ces architectures.

Maîtriser les conditions de mise en oeuvre de ces implémentations.