JOUR 1 – Architectures fondamentales, embeddings et applications classiques
# 1.1 – Présentation des architectures fondamentales
* Architectures convolutives : principes fondateurs, caractéristiques (invariance par translation), principales évolutions de 2012 à 2020 (connexion résiduelle, normalisations, etc.)
* Architecture Transformer : architecture selon Vaswani et al, mécanisme d’attention, position embeddings.
* Vision Transformer : division par patches et premiers résultats (Google, Dosovitskiy et al) mitigés.
* Swin Transformers & Swin Transformers v2 : évolution d’architecture, approche hiérarchique de l’image, évolution de la résolution en v2
* Analyse : CNN Versus Transformers. Pourquoi ce dernier s’est imposé.

# 1.2 – Feature maps, foundation models, cross-embeddings : représentations d’une image
* Features dans un modèle convolutif : exemple de l’approche Lucid, intérêt de l’invariance.
* Features dans un modèle Transformer : limites d’interprétation, analyse de l’attention.
* Apprentissage auto-supervisé de représentation d’une image : modèle Dino. Détails de l’entraînement et de l’architecture. Applications visées pour un premier modèle fondation.
* De Dino à Dino v2 : accélération et stabilisation de l’entraînement. Problèmes de localisation dans l’espace latent, et solution avec les « Registers » (complément Dino v2)
* Dino v3 : améliorations. Exemples de retours d’expérience en utilisation sur différentes bases d’images.
* De l’embedding au cross-embedding : analyse des liens langage-image d’OpenAI CLIP. Explication du Contrastive Learning. Limites fortes du modèle (Analyses deepmind sur les capacités de comptage)
* Approche ImageBind : génération d’embeddings à travers six modalités différentes.
* Analyse : quand et comment utiliser ces embeddings face à un problème concret.

# 1.3 – Du Large Language Model au Vision Language Model
* Apparition des premiers VLMs depuis les travaux en cross-embeddings. Enjeux et limites des modèles générés.
* Premier VLM : Analyse de Llava (Microsoft, Liu et al). Architecture (Vision Encoder + LLM) et détails d’entraînements. Résultats observés
* Analyse : Qwen2-VL : architecture et entraînement. Résultats obtenus
* Etude de cas : l’OCR est-il géré par les VLMs ?
* Etude de cas : quand/comment utiliser un VLM aujourd’hui sur un problème concret ?

# 1.4 – Application : détection d’éléments dans une image
* Parcours des approches Yolo originales (par J Redmon). Détail de la loss, approche multi-scaling, critiques de la métrique mAP, limites de l’incertitude
* Parcours des approches Yolo suivantes (par Ultralytics). Extraction des principales évolutions d’architecture, d’entraînement et optimisation de l’inférence
* Approches Transformer en détection : modèle DETR (Carion et al) & Deformable DETR (Zhu et al) pour optimisation de l’attention.
* Approches Transformer en détection : Adaptation de DINO (Grounding DINO, Liu et al) et approche DETR temps réel (RF-DETR, Robinson et al)

# 1.5 – Application : segmentation dans une image
* Parcours des approches SegmentAnything : base, amélioration du dataset et adaptation à la vidéo (SAM v2), exploitation du langage en entrée et mémoire pour la vidéo (SAM v3)
* Revue de solutions en segmentation depuis les approches déjà présentées.

JOUR 2 – Modèles génératifs, applications complexes et ouvertures (3d, vidéo)
# 2.1 – Modèles génératifs et modèles de diffusion
Attention : les mathématiques des modèles de diffusion sont ici survolées par souci de concision, une formation dédiée existe.
* Approches génératives d’apprentissage de distribution : principes et architectures fondamentales. Cas du VAE initial (Kingma et al), puis des approches avec quantification (VQ-VAE, Oord et al, VQ-VAE 2, Razavi et al)
* Modèles de diffusion : présentation de la modélisation fondamentale entre débruitage et gradient de la distribution. Architectures fondamentale de Song et al.
* Modèles de diffusion : revue en détail de Stable Diffusion (Rombach et al). Apprentissage de l’encodeur/décodeur, diffusion du vecteurs latents, injection de conditions en génération.
* ControlNet : présentation de l’architecture pour adaptation d’un modèle de diffusion.
* Evolution des modèles de diffusion : distillation et Consistency Models

# 2.2 – Application : résolution de problèmes inverses
* Rappel de modélisation d’un problème inverse, exemples de problèmes, limites fortes de résolution, apprentissage de la distribution cible.
* Application directe des modèles de diffusion aux problèmes inverses
* Exemple : Inpainting, approche RePaint (Lugmayr et al)
* Exemple : Restoration d’images, approche DiffBIR (Lin et al)

# 2.3 – Application : détection d’anomalies dans une image
* Vision globale de la détection d’anomalies. Impossibilité d’un apprentissage supervisé.
* Détection d’anomalie par exploitation de vecteurs latents issus de CLIP ou Dino.
* Exemple : AdaCLIP (Cao et al)
* Détection d’anomalie par modélisation de la distribution. Exemples par entraînement d’un VAE ou VQ-VAE.
* Détection d’anomalies par modèles de diffusion. Exemples en imagerie médicale

# 2.4 – Ouverture : de l’image à la vidéo
* Approche par images (frame based) ou approche sur l’ensemble de la vidéo : enjeux
* Etude de cas : tracking frame-based vs tracking video-based. Enjeux de résultats et d’itération contrôlée sur la qualité.
* Analyse : Lumiere: A Space-Time Diffusion Model for Video Generation (Bar-Tal et al)

# 2.5 – Ouverture : gestion de volumes 3d en Deep Learning
* Limite des approches classiques (nuages de points, voxels)
* Principe des Signed Distance Function et Neural Render Field (NeRF) pour apprendre un volume 3d par un modèle Deep Learning.
* Approche InstantNGP (Neural Graphic Primitives) par NVIDIA. Détail de l’architecture (notamment, hashing dynamique) en optimisation de la représentation apprise.
* Optimisation du rendu par le Gaussian Splatting (Kerbl et al).
* Utilisation du langage en contrôle de NeRF ? Présentation de cas.
* Applications des NeRF ou plus généralement du Neural Rendering. Modélisation 4d (animation)
