Si les Large Language Models occupent l’attention, l’intelligence artificielle est aussi, depuis 2012, une voie royale (non sans écueils) pour les applications en image, volume 3d et vidéo. Cette formation vise à donner l’ensemble des clés techniques et scientifiques sur les différentes approches et implémentations existant en 2026 en Deep Learning adapté à l’image. Reprenant les architectures fondamentales (CNN, Vision Transformer, NeRF, Diffusion), la formation présente aussi les principaux champs d’application en relevant les avantages mais aussi les limites de ces approches.

Moyens techniques

Support de cours projeté pendant la formation et transmis à l’ensemble des stagiaires à l’issue de la formation; Publications scientifiques/Benchmarks/Liens github citées et liens communiqués; Etudes de cas avec choix en début de formation selon les domaines d’intérêt des stagiaires

Suivi de l’exécution

Emargement demandé chaque demie-journée à tous les stagiaires Évaluation : Questionnaire d’évaluation des acquis à l’issue de la formation

Appréciation des résultats

Questionnaire de satisfaction à l’issue de la formation

Objectifs pédagogiques

 
 

JOUR 1 – Architectures fondamentales, embeddings et applications classiques

 
 

# 1.1 – Présentation des architectures fondamentales

* Architectures convolutives : principes fondateurs, caractéristiques (invariance par translation), principales évolutions de 2012 à 2020 (connexion résiduelle, normalisations, etc.)
* Architecture Transformer : architecture selon Vaswani et al, mécanisme d’attention, position embeddings.
* Vision Transformer : division par patches et premiers résultats (Google, Dosovitskiy et al) mitigés.
* Swin Transformers & Swin Transformers v2 : évolution d’architecture, approche hiérarchique de l’image, évolution de la résolution en v2
* Analyse : CNN Versus Transformers. Pourquoi ce dernier s’est imposé.

 
 

# 1.2 – Feature maps, foundation models, cross-embeddings : représentations d’une image

* Features dans un modèle convolutif : exemple de l’approche Lucid, intérêt de l’invariance.
* Features dans un modèle Transformer : limites d’interprétation, analyse de l’attention.
* Apprentissage auto-supervisé de représentation d’une image : modèle Dino. Détails de l’entraînement et de l’architecture. Applications visées pour un premier modèle fondation.
* De Dino à Dino v2 : accélération et stabilisation de l’entraînement. Problèmes de localisation dans l’espace latent, et solution avec les « Registers » (complément Dino v2)
* Dino v3 : améliorations. Exemples de retours d’expérience en utilisation sur différentes bases d’images.
* De l’embedding au cross-embedding : analyse des liens langage-image d’OpenAI CLIP. Explication du Contrastive Learning. Limites fortes du modèle (Analyses deepmind sur les capacités de comptage)
* Approche ImageBind : génération d’embeddings à travers six modalités différentes.
* Analyse : quand et comment utiliser ces embeddings face à un problème concret.


 
 

# 1.3 – Du Large Language Model au Vision Language Model

* Apparition des premiers VLMs depuis les travaux en cross-embeddings. Enjeux et limites des modèles générés.
* Premier VLM : Analyse de Llava (Microsoft, Liu et al). Architecture (Vision Encoder + LLM) et détails d’entraînements. Résultats observés
* Analyse : Qwen2-VL : architecture et entraînement. Résultats obtenus
* Etude de cas : l’OCR est-il géré par les VLMs ?
* Etude de cas : quand/comment utiliser un VLM aujourd’hui sur un problème concret ?


 
 

# 1.4 – Application : détection d’éléments dans une image

* Parcours des approches Yolo originales (par J Redmon). Détail de la loss, approche multi-scaling, critiques de la métrique mAP, limites de l’incertitude
* Parcours des approches Yolo suivantes (par Ultralytics). Extraction des principales évolutions d’architecture, d’entraînement et optimisation de l’inférence
* Approches Transformer en détection : modèle DETR (Carion et al) & Deformable DETR (Zhu et al) pour optimisation de l’attention.
* Approches Transformer en détection : Adaptation de DINO (Grounding DINO, Liu et al) et approche DETR temps réel (RF-DETR, Robinson et al)


 
 

# 1.5 – Application : segmentation dans une image

* Parcours des approches SegmentAnything : base, amélioration du dataset et adaptation à la vidéo (SAM v2), exploitation du langage en entrée et mémoire pour la vidéo (SAM v3)
* Revue de solutions en segmentation depuis les approches déjà présentées.


 
 
 
 

JOUR 2 – Modèles génératifs, applications complexes et ouvertures (3d, vidéo)

 
 

# 2.1 – Modèles génératifs et modèles de diffusion

Attention : les mathématiques des modèles de diffusion sont ici survolées par souci de concision, une formation dédiée existe.
* Approches génératives d’apprentissage de distribution : principes et architectures fondamentales. Cas du VAE initial (Kingma et al), puis des approches avec quantification (VQ-VAE, Oord et al, VQ-VAE 2, Razavi et al)
* Modèles de diffusion : présentation de la modélisation fondamentale entre débruitage et gradient de la distribution. Architectures fondamentale de Song et al.
* Modèles de diffusion : revue en détail de Stable Diffusion (Rombach et al). Apprentissage de l’encodeur/décodeur, diffusion du vecteurs latents, injection de conditions en génération.
* ControlNet : présentation de l’architecture pour adaptation d’un modèle de diffusion.
* Evolution des modèles de diffusion : distillation et Consistency Models


 
 

# 2.2 – Application : résolution de problèmes inverses

* Rappel de modélisation d’un problème inverse, exemples de problèmes, limites fortes de résolution, apprentissage de la distribution cible.
* Application directe des modèles de diffusion aux problèmes inverses
* Exemple : Inpainting, approche RePaint (Lugmayr et al)
* Exemple : Restoration d’images, approche DiffBIR (Lin et al)


 
 

# 2.3 – Application : détection d’anomalies dans une image

* Vision globale de la détection d’anomalies. Impossibilité d’un apprentissage supervisé.
* Détection d’anomalie par exploitation de vecteurs latents issus de CLIP ou Dino.
* Exemple : AdaCLIP (Cao et al)
* Détection d’anomalie par modélisation de la distribution. Exemples par entraînement d’un VAE ou VQ-VAE.
* Détection d’anomalies par modèles de diffusion. Exemples en imagerie médicale


 
 

# 2.4 – Ouverture : de l’image à la vidéo

* Approche par images (frame based) ou approche sur l’ensemble de la vidéo : enjeux
* Etude de cas : tracking frame-based vs tracking video-based. Enjeux de résultats et d’itération contrôlée sur la qualité.
* Analyse : Lumiere: A Space-Time Diffusion Model for Video Generation (Bar-Tal et al)


 
 

# 2.5 – Ouverture : gestion de volumes 3d en Deep Learning

* Limite des approches classiques (nuages de points, voxels)
* Principe des Signed Distance Function et Neural Render Field (NeRF) pour apprendre un volume 3d par un modèle Deep Learning.
* Approche InstantNGP (Neural Graphic Primitives) par NVIDIA. Détail de l’architecture (notamment, hashing dynamique) en optimisation de la représentation apprise.
* Optimisation du rendu par le Gaussian Splatting (Kerbl et al).
* Utilisation du langage en contrôle de NeRF ? Présentation de cas.
* Applications des NeRF ou plus généralement du Neural Rendering. Modélisation 4d (animation)


 
 

Technologies abordées

Architectures fondamentales : CNN, Vision Transformer.
Embeddings : Dino (v1 à V3), OpenAI CLIP, ImageBind.
Vision Language Models depuis les Large Language Models. Qwen2-VL
Détection, segmentation : Yolos, DETR, SAM (v1 à v3)
Architectures génératives : VAE, VQ-VAE, Modèles de Diffusion
3d : SDF, NeRF
Frameworks technologiques supportant la formation : CUDA, Pytorch, et implémentations open-source des principaux projets.

Compétences visées

Disposer d’une connaissance à date des principales architectures utilisées.

Connaître les éléments d’analyse et de critique des implémentations possibles de ces architectures.

Maîtriser les conditions de mise en oeuvre de ces implémentations.