On Policy Distillation - Using LLMs to train better LLMs

On Policy Distillation - Using LLMs to train better LLMs

🎙 Neural Breakdown with AVB 👥 34K 📅 23 août 2026 ⏱ 30 min 👁 31 📄 vulgarisation 🧭 2026-08-23
Disponible en : Français (actuel) English

Mots-clés

on-policy distillationself-distillationKL divergenceSFTDPORLVR

Résumé

La vidéo présente une explication visuelle de la distillation sur politique (OPD) et de la distillation sur politique auto-supervisée (OPSD), deux techniques utilisées pour entraîner des modèles de langage (LLM). L’auteur commence par rappeler le concept classique de distillation de connaissances, puis explique la différence entre l’apprentissage hors politique (off-policy) et sur politique (on-policy). Il détaille le mécanisme de l’OPD : le modèle étudiant génère des séquences, puis le modèle enseignant fournit une supervision dense au niveau des tokens. Il compare différentes méthodes de supervision (échantillonnage, vocabulaire complet, top-k) et discute des divergences KL avant et arrière, ainsi que de la divergence de Jensen-Shannon. La vidéo aborde ensuite la distillation auto-supervisée (OPSD), où le même modèle sert d’enseignant en utilisant des informations privilégiées (par exemple, des indices ou des réflexions). L’auteur met en garde contre le biais de rétrospection et l’illusion de privilège. Enfin, il propose des recommandations pour choisir entre SFT, DPO, RLVR et OPD selon les objectifs, et mentionne des ressources pratiques comme le blog Thinking Machines et des bibliothèques (TRL, GKD).

174 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur pédagogique certaine en clarifiant des concepts complexes de l’apprentissage des LLM. L’argumentation est structurée et progressive, avec des exemples concrets (problème de mathématiques, analogie des îles) qui facilitent la compréhension. L’auteur distingue clairement les différentes méthodes (SFT, DPO, RL, OPD) et explique les compromis entre elles. Il s’appuie sur des références récentes (miniLM, GKD, SDPO, DOPD) et des ressources en ligne, ce qui renforce la crédibilité. Cependant, certaines explications restent superficielles et auraient mérité plus de détails techniques, notamment sur les implémentations pratiques.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est globalement bonne : l’auteur cite des articles et des ressources fiables (Thinking Machines blog, GitHub, articles sur X). Il prend soin de nuancer ses affirmations et de mentionner les limites des méthodes. L’adéquation entre le titre et le contenu est parfaite. La qualité des sources est correcte, même si certaines références sont des tweets ou des articles de blog non évalués par des pairs. La vidéo ne comporte pas de séquence publicitaire.

179 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : la vidéo explique en détail la distillation sur politique (on-policy distillation) et ses variantes.

Qualité & fiabilité

7/10

Explication claire et structurée des concepts, avec références à des travaux et articles de recherche. Certaines affirmations manquent de précision ou de citations directes, mais l'ensemble est globalement fiable.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

La vidéo apporte une synthèse claire et accessible de la distillation sur politique, un sujet émergent. Elle met en lumière les nuances entre les différentes divergences (KL avant/arrière, JSD) et les implications pratiques. L’accent sur la distillation auto-supervisée et l’illusion de privilège est particulièrement pertinent.

Pour aller plus loin :

118 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique correct, mais la fiabilité et la qualité sont légèrement inférieures, ce qui reflète une vulgarisation avec quelques approximations.

Fiabilité 7/10