How to Build a Modern Diffusion Language Model

How to Build a Modern Diffusion Language Model

🎙 Volodymyr Kuleshov 👥 75K 📅 6 août 2026 ⏱ 48 min 👁 677 📄 exposé technique 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

diffusionmodèles de langagegénération parallèlemasked diffusioninférence

Résumé

Dans cette conférence, Volodymyr Kuleshov (Cornell University) présente les principes de construction des modèles de langage à diffusion modernes. Il commence par motiver l’intérêt de ces modèles : contrairement aux modèles autorégressifs, ils génèrent les tokens en parallèle, ce qui permet une génération plus rapide, une correction d’erreur intégrée et des modifications globales de la séquence. Il rappelle ensuite les bases de la diffusion gaussienne (processus forward et reverse) puis introduit la diffusion discrète par masquage, popularisée par son groupe. L’exposé détaille les techniques avancées : raffinement itératif, génération contrôlable, inférence efficace avec des séquences de longueur variable. Il illustre ces concepts avec des modèles open source récents (Nemotron Diffusion, Gemma Diffusion, Mercury 2) et des applications en biologie (protéines, ADN). La présentation souligne les avantages de ces modèles pour le scaling au moment de l’inférence et pour la génération contrôlable, notamment dans les sciences.

145 mots

Évaluation critique

La conférence de Volodymyr Kuleshov offre une introduction technique solide et bien structurée aux modèles de langage à diffusion. L’orateur, chercheur reconnu dans le domaine, présente les concepts avec clarté, en s’appuyant sur des exemples concrets et des modèles récents. La valeur des informations est élevée : on y apprend les fondements de la diffusion masquée, les techniques d’inférence accélérée et les applications en biologie. L’argumentation est cohérente : il justifie l’intérêt de ces modèles par les limites des modèles autorégressifs (génération séquentielle, lenteur) et montre comment la diffusion permet de les dépasser. La rigueur scientifique est bonne : les concepts sont définis précisément, et l’orateur répond aux questions de l’auditoire avec précision. Cependant, certaines affirmations sur les performances (par exemple, la vitesse de génération de plus de 1000 tokens par seconde) ne sont pas étayées par des références précises dans la vidéo. De plus, la présentation reste à un niveau relativement avancé, ce qui pourrait limiter son accessibilité à un public non spécialiste. L’adéquation entre le titre et le contenu est parfaite : il s’agit bien d’un guide pour construire un modèle de langage à diffusion. En résumé, une conférence de qualité, riche en informations et bien argumentée, mais qui gagnerait à citer plus systématiquement ses sources.

208 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : il s'agit bien d'un guide pour construire un modèle de langage à diffusion moderne.

Qualité & fiabilité

8/10

Exposé technique de haut niveau par un chercheur reconnu, s'appuyant sur des travaux publiés et des modèles open source récents. La présentation est structurée et didactique, mais certaines affirmations sur les performances (ex. vitesse de génération) ne sont pas sourcées dans la vidéo.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Cette conférence apporte une synthèse claire et actualisée des techniques de construction de modèles de langage à diffusion, en mettant l’accent sur les modèles open source récents. Elle explique les avantages de ces modèles pour la génération parallèle, la correction d’erreur et le scaling à l’inférence, et illustre leur application dans les sciences (biologie, génomique).

Pour aller plus loin :

  • Masked Diffusion Language Models — Article fondateur sur les modèles de langage à diffusion masquée.
  • Diffusion Language Models — Article de référence sur les modèles de langage à diffusion.
  • Mercury 2 — Article sur le modèle Mercury 2 (si disponible).
  • Gemma Diffusion — Article sur le modèle Gemma Diffusion (si disponible).
  • Nemotron Diffusion — Article sur le modèle Nemotron Diffusion (si disponible).

122 mots

Profil radar

Le profil radar montre un niveau technique élevé (9/10) et une bonne qualité d'information (8/10), mais une fiabilité globale légèrement inférieure (8/10) en raison de l'absence de sources détaillées dans la vidéo. La quantité d'information est également bonne (8/10).

Fiabilité 8/10