Stanford CS229 Machine Learning | Spring 2026 | Lecture 11: Diffusion Models

Stanford CS229 Machine Learning | Spring 2026 | Lecture 11: Diffusion Models

🎙 Stanford Online 👥 1.2M 📅 31 juillet 2026 ⏱ 82 min 👁 2K 📄 cours magistral 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

diffusion modelsgénération d'imagesprocessus de bruitinférence variationnelleEM algorithm

Résumé

Ce cours de Stanford CS229, donné par Tengyu Ma, présente les modèles de diffusion pour la génération d’images. L’objectif est de générer des images réalistes à partir d’un bruit gaussien en apprenant à inverser un processus de bruit progressif. Le cours commence par situer les modèles de diffusion par rapport aux GAN et aux VAE, puis détaille le processus de bruit : à chaque étape, on ajoute un bruit gaussien à l’image, en réduisant légèrement l’échelle. La covariance de l’image bruitée est une interpolation linéaire entre la covariance de l’image originale et l’identité, ce qui maintient l’échelle globale. En déroulant le processus, on obtient une formule fermée pour l’image bruitée à un pas donné, qui est une combinaison linéaire de l’image originale et d’un bruit gaussien. Le cours introduit la notation alpha-bar pour simplifier cette formule. Ensuite, il explique comment apprendre le processus inverse en utilisant l’inférence variationnelle, en minimisant une divergence de KL entre la distribution postérieure et une distribution approximative. Le cours mentionne également des applications pratiques, comme la génération d’images, de vidéos et d’actions pour la robotique, ainsi que l’utilisation de modèles de diffusion pour accélérer les modèles de langage. La présentation est technique et s’adresse à des étudiants en machine learning.

205 mots

Évaluation critique

Le cours offre une introduction solide aux modèles de diffusion, couvrant à la fois les concepts fondamentaux et les détails mathématiques. La démarche pédagogique est progressive : on part de l’idée intuitive de débruiter une image pour arriver à la formulation mathématique du processus de bruit et de son inversion. La dérivation de la formule fermée pour l’image bruitée est bien expliquée, avec une attention particulière à la covariance et à la conservation de l’échelle. L’utilisation de l’inférence variationnelle pour apprendre le processus inverse est également bien motivée, bien que la présentation soit parfois confuse en raison de la transcription. La qualité des sources est excellente, puisqu’il s’agit d’un cours de Stanford, et les références au cours CS229 et au programme d’IA de Stanford sont fournies. Cependant, la transcription contient de nombreuses erreurs et hésitations (par exemple, ‘gshian’ pour ‘gaussien’, ‘regulion’ pour ‘gaussien’), ce qui peut nuire à la compréhension pour un non-initié. De plus, le cours ne couvre pas certains aspects pratiques comme le choix des hyperparamètres (bêta) ou les architectures de réseaux de neurones utilisées, ce qui limite son exhaustivité. L’adéquation entre le titre et le contenu est parfaite. En résumé, ce cours est une ressource de qualité pour les étudiants en machine learning qui souhaitent comprendre les modèles de diffusion, mais il nécessite une certaine familiarité avec les concepts mathématiques et une attention particulière en raison de la transcription imparfaite.

233 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : il s'agit bien de la onzième leçon du cours CS229 de Stanford sur les modèles de diffusion.

Qualité & fiabilité

8/10

Cours magistral de niveau universitaire (Stanford CS229) dispensé par des professeurs reconnus. Le contenu est rigoureux, avec des dérivations mathématiques et des explications conceptuelles. La fiabilité est élevée, mais la transcription contient des erreurs et des hésitations qui peuvent nuire à la clarté.

Moments clés

Sources citées

Sources concordantes

Sources discordantes

  • Aucune source discordante identifiée — Le contenu du cours est conforme aux connaissances établies sur les modèles de diffusion.

Apport & nouveautés

Ce cours apporte une explication pédagogique claire des modèles de diffusion, en mettant l’accent sur les fondements mathématiques (processus de bruit, covariance, inférence variationnelle). Il s’agit d’un contenu de niveau universitaire, utile pour les étudiants en machine learning. L’originalité réside dans la présentation progressive et la mise en relation avec l’algorithme EM.

Pour aller plus loin :

132 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés (8/10) sur les quatre axes, indiquant une ressource de très bonne qualité, avec une quantité d'information substantielle, une qualité pédagogique solide, un niveau technique avancé et une fiabilité élevée.

Fiabilité 8/10