JOUR 1 – Architecture et entraînement des Large Language Models
1.1 – Introduction et rappels
* Premiers modèles de langage : approche Word2Vec (Milokov et al), CharRNN (Karpathy)
* Guerre en 2017 entre modèles convolutifs et récurrents, avant l’arrivée du Transformer
* Reprise de l’architectuyre Transformer (Vaswani et al) : embeddings de position, module d’attention, génération auto-régressive, normalisation et architecture globale encoder/decoder

1.2 – Embeddings de position et mécanismes d’attention
* Enjeu de l’embedding de position selon la tâche adressée.
* Présentation du Rotary Positional Embedding (Su et al), mécanisme et résultats. Présentation « Attention with Linear Biases » (ALiBi, Press et al)
* Bottleneck du calcul d’attention et complexité quadratique. Parcours de solutions recherchées en prédiction de séries temporelles
* Focus sur les approches « Flash Attention » (Dao et al, Shah et al). Présentation des trois travaux incrémentaux en identifiant les avancées et résultats obtenus.
* Approches proposées par DeepSeek : Multihead Latent Attention (v2), DeepSeek Sparse Attention (v3)

1.3 – Mixture of Experts : Equililbre entre taille du modèle et rapidité d’inférence
* Adaptation dynamique de la charge : présentation de l’approche globale, exemple des Universal Transformers
* Premiers travaux MoE et fondamentaux : Switch Transformers, GShard
* Principes fondateurs des approches Mixture of Experts : sélection (Top-K Routing, Soft Routing), architecture (Hierarchical, Orthogonal, Calibrated MoE)
* Etude DeepSeek MOE (Dai et al)

1.4 – Etude de cas d’architecture : DeepSeek v3
* Parcours des éléments d’architecture DeepSeek v3 relativement aux points vus en court pour obtenir une vision globale du modèle.

1.5 – Entraînement d’un Large Language Model
* Entraînement initial du Transformer : implémentation et limites
* Vision globale des différentes phases d’entraînement d’un LLM aujourd’hui. Importance du pretraining (général) face aux entraînements spécialisés (résolution de tâches)
* Deep Reinforcement Learning : introduction des éléments fondamentaux : modélisation, reward, objectif global, policy function.
* Reinforcement Learning via Human Feedback (Ouyang et al) : présentation des travaux depuis le Proximal Policy Optimization. Implémentation et limites.
* Direct Preference Optimization & Reinforcement Learning with Verifiable Rewards : algorithmes et résultats (Lambert et al)
* DeepSeek-Math : présentation du Group Relative Policy Optimization.

1.6 – Etude de cas d’architecture : DeepSeek-R1
* Analyse de l’architecture et de l’entraînement du modèle relativement aux points vus en court pour obtenir une vision globale.
JOUR 2 – Paradigme agentique. Optimisation, sécurité et interprétabilité des LLMs
2.1 – Du LLM au système agentique
* Principe d’itération des LLMs
* Introduction d’outils en recherche LLM : application au développement logiciel, focus sur l’approche AutoCodeRover (Zhang et al). Formes d’appels d’un outil (MCP, CLI, code).
* Itération et source de vérité : illustration via l’approche AlphaGeometry (Trinh et al) d’isolation du LLM comme moteur d’exploration confronté à un moteur symbolique
* Aux origines des agents : retour sur les travaux de Stanford (Generative Agents: Interactive Simulacra of Human Behavior), enjeux de propagation d’information et de gestion de la mémoire
* Du Chain of Thought à la planification agentique : principes et applications

2.2 – Adaptation des LLMs pour les usages agentiques
* Etude de cas : spécificités agentiques pour le modèle GLM-5
* Etude de cas : DeepSeek-v4, et RAG vs Agentic Search
* Le bottleneck de la mémoire d’un système agentique : étude de différents systèmes de mémoire avec pour chacun leurs limites connues. Focus sur « A-MEM » (Xu et al) et analyse critique.

2.3 – Optimisation et Fine Tuning d’un LLM
* Optimisations simples en Deep Learning. Différence des besoins de calcul entre entraînement et inférence. Impacts de la quantification
* Approches d’optimisation et de fine tuning : « Low Rank Factorization » (LoRA) et distillation. Exemples d’applications.
* Optimisation à l’inférence : limite du modèle auto-regressif. Enjeux du « Key-Value Cache » (KV Cache). Optimisations au niveau token, modèle ou au niveau système
* Etude de cas : TurboQuant.

2.4 – Interprétabilité des LLMs
* L’interprétabilité du Deep Learning : rappel du contexte et des blocages forts face à un réseau de neurones. Enjeux des embeddings, limites de l’observation de l’attention
* Approches de Sparse Autoencoding : principe et résultats observables, limites.
* Extraction de circuits d’un modèle : approche et résultats
* Focus sur l’approche par jacobien d’Anthropic : « J-Space »
* Prise de recul sur l’interprétabilité interne et la volonté de traçabilité d’un système IA

2.5 – Sécurité des LLMs
* Présentation des attaques adversariales et applications aux LLMs.
* Injection de prompts et jailbreaking : présentation de différentes approches. Solutions de mitigation et de test. Présentation de l’outil « Garak » de NVIDIA (LLM PenTesting)
* Protection de la donnée et LLMs : extraction de la donnée d’entraînement (Model Inversion / Membership inference), ou empoisonnement d’un dataset de train/fine-tuning.
* Prise de recul et vision globale de la sécurité d’un système agentique. Recommandations.

2.6 – Evolutions futures des modèles
* Parcours de culture générale : World Models comme complément des LLMs. Architectures State-Space (Mamba). Large Diffusion Language Models. Présentation des statuts à date et des perspectives futures.