Les Large Language Models se sont largement imposés comme l’architecture centrale de l’IA depuis l’apparition du Transformer. De nombreux travaux ont cherché à améliorer ces outils : architecture des modèles, évolution des entraînements (et arrivée du renforcement), passage aux systèmes agentiques, etc. Cette formation vise à donner les clés scientifiques et techniques pour obtenir une bonne compréhension des architectures actuelles LLM ou agentiques et de leurs entraînements. Elle creuse aussi les sujets de l’optimisation de ces modèles comme de leur sécurité, et ouvre ensuite les grandes évolutions à venir (Diffusion, Mamba)

Moyens techniques

Support de cours projeté pendant la formation et transmis à l’ensemble des stagiaires à l’issue de la formation; cas et exemples pratiques choisis selon les domaines d’intérêt des stagiaires

Suivi de l’exécution

Emargement demandé chaque demie-journée à tous les stagiaires Évaluation : Questionnaire d’évaluation des acquis à l’issue de la formation

Appréciation des résultats

Questionnaire de satisfaction à l’issue de la formation

Objectifs pédagogiques

JOUR 1 – Architecture et entraînement des Large Language Models

 
 

1.1 – Introduction et rappels

* Premiers modèles de langage : approche Word2Vec (Milokov et al), CharRNN (Karpathy)
* Guerre en 2017 entre modèles convolutifs et récurrents, avant l’arrivée du Transformer
* Reprise de l’architectuyre Transformer (Vaswani et al) : embeddings de position, module d’attention, génération auto-régressive, normalisation et architecture globale encoder/decoder


 
 

1.2 – Embeddings de position et mécanismes d’attention

* Enjeu de l’embedding de position selon la tâche adressée.
* Présentation du Rotary Positional Embedding (Su et al), mécanisme et résultats. Présentation « Attention with Linear Biases » (ALiBi, Press et al)
* Bottleneck du calcul d’attention et complexité quadratique. Parcours de solutions recherchées en prédiction de séries temporelles
* Focus sur les approches « Flash Attention » (Dao et al, Shah et al). Présentation des trois travaux incrémentaux en identifiant les avancées et résultats obtenus.
* Approches proposées par DeepSeek : Multihead Latent Attention (v2), DeepSeek Sparse Attention (v3)

 
 

1.3 – Mixture of Experts : Equililbre entre taille du modèle et rapidité d’inférence

* Adaptation dynamique de la charge : présentation de l’approche globale, exemple des Universal Transformers
* Premiers travaux MoE et fondamentaux : Switch Transformers, GShard
* Principes fondateurs des approches Mixture of Experts : sélection (Top-K Routing, Soft Routing), architecture (Hierarchical, Orthogonal, Calibrated MoE)
* Etude DeepSeek MOE (Dai et al)

 
 

1.4 – Etude de cas d’architecture : DeepSeek v3

* Parcours des éléments d’architecture DeepSeek v3 relativement aux points vus en court pour obtenir une vision globale du modèle.

 
 

1.5 – Entraînement d’un Large Language Model

* Entraînement initial du Transformer : implémentation et limites
* Vision globale des différentes phases d’entraînement d’un LLM aujourd’hui. Importance du pretraining (général) face aux entraînements spécialisés (résolution de tâches)
* Deep Reinforcement Learning : introduction des éléments fondamentaux : modélisation, reward, objectif global, policy function.
* Reinforcement Learning via Human Feedback (Ouyang et al) : présentation des travaux depuis le Proximal Policy Optimization. Implémentation et limites.
* Direct Preference Optimization & Reinforcement Learning with Verifiable Rewards : algorithmes et résultats (Lambert et al)
* DeepSeek-Math : présentation du Group Relative Policy Optimization.

 
 

1.6 – Etude de cas d’architecture : DeepSeek-R1

* Analyse de l’architecture et de l’entraînement du modèle relativement aux points vus en court pour obtenir une vision globale.

 
 

 
 

JOUR 2 – Paradigme agentique. Optimisation, sécurité et interprétabilité des LLMs

 

 

2.1 – Du LLM au système agentique

* Principe d’itération des LLMs
* Introduction d’outils en recherche LLM : application au développement logiciel, focus sur l’approche AutoCodeRover (Zhang et al). Formes d’appels d’un outil (MCP, CLI, code).
* Itération et source de vérité : illustration via l’approche AlphaGeometry (Trinh et al) d’isolation du LLM comme moteur d’exploration confronté à un moteur symbolique
* Aux origines des agents : retour sur les travaux de Stanford (Generative Agents: Interactive Simulacra of Human Behavior), enjeux de propagation d’information et de gestion de la mémoire
* Du Chain of Thought à la planification agentique : principes et applications

 
 

2.2 – Adaptation des LLMs pour les usages agentiques

* Etude de cas : spécificités agentiques pour le modèle GLM-5
* Etude de cas : DeepSeek-v4, et RAG vs Agentic Search
* Le bottleneck de la mémoire d’un système agentique : étude de différents systèmes de mémoire avec pour chacun leurs limites connues. Focus sur « A-MEM » (Xu et al) et analyse critique.

 
 

2.3 – Optimisation et Fine Tuning d’un LLM

* Optimisations simples en Deep Learning. Différence des besoins de calcul entre entraînement et inférence. Impacts de la quantification
* Approches d’optimisation et de fine tuning : « Low Rank Factorization » (LoRA) et distillation. Exemples d’applications.
* Optimisation à l’inférence : limite du modèle auto-regressif. Enjeux du « Key-Value Cache » (KV Cache). Optimisations au niveau token, modèle ou au niveau système
* Etude de cas : TurboQuant.

 
 

2.4 – Interprétabilité des LLMs

* L’interprétabilité du Deep Learning : rappel du contexte et des blocages forts face à un réseau de neurones. Enjeux des embeddings, limites de l’observation de l’attention
* Approches de Sparse Autoencoding : principe et résultats observables, limites.
* Extraction de circuits d’un modèle : approche et résultats
* Focus sur l’approche par jacobien d’Anthropic : « J-Space »
* Prise de recul sur l’interprétabilité interne et la volonté de traçabilité d’un système IA

 
 

2.5 – Sécurité des LLMs

* Présentation des attaques adversariales et applications aux LLMs.
* Injection de prompts et jailbreaking : présentation de différentes approches. Solutions de mitigation et de test. Présentation de l’outil « Garak » de NVIDIA (LLM PenTesting)
* Protection de la donnée et LLMs : extraction de la donnée d’entraînement (Model Inversion / Membership inference), ou empoisonnement d’un dataset de train/fine-tuning.
* Prise de recul et vision globale de la sécurité d’un système agentique. Recommandations.

 
 

2.6 – Evolutions futures des modèles

* Parcours de culture générale : World Models comme complément des LLMs. Architectures State-Space (Mamba). Large Diffusion Language Models. Présentation des statuts à date et des perspectives futures.

Technologies abordées

Architectures fondamentales : CNN, Transformer
Attention : FlashAttention, RoPE
Modèles cibles : DeepSeek, Qwen, KIMI
Optimisation : LoRA, Distillation, TurboQuant
Sécurité : Garak (nvidia)

Compétences visées

Disposer d’une connaissance à date des principales architectures utilisées.

Connaître les éléments d’analyse et de critique des implémentations possibles de ces architectures.

Maîtriser les conditions de mise en oeuvre de ces implémentations.