11: Generative AI – Text-to-Image Models

11: Generative AI – Text-to-Image Models

🎙 Rama Ramakrishnan 👥 6.4M 📅 7 janvier 2026 ⏱ 75 min 👁 15K 📄 cours magistral 🧭 2026-08-13
Disponible en : Français (actuel) English

Mots-clés

diffusionCLIPU-NetStable Diffusiontext-to-image

Résumé

Ce cours magistral du MIT (15.773) présente les modèles de diffusion conditionnés par du texte pour la génération d’images. L’instructeur commence par expliquer le principe de base : ajouter du bruit à des images pour créer des paires d’entraînement, puis apprendre à un réseau à débruiter progressivement. Il détaille l’architecture U-Net, avec ses connexions résiduelles, pour la transformation image-à-image. Ensuite, il introduit CLIP, un modèle contrastif qui aligne les embeddings de texte et d’image dans un espace commun, permettant de conditionner la génération. Il montre comment intégrer l’embedding de texte dans le processus de débruitage pour guider la génération. Enfin, il aborde les modèles de diffusion latente (comme Stable Diffusion) pour accélérer le processus, et fait une démonstration pratique avec la bibliothèque Hugging Face diffusers. Le cours se conclut sur des applications plus larges (génération de vidéos, structures 3D) et une ouverture sur les modèles multimodaux.

146 mots

Évaluation critique

Ce cours offre une introduction solide et pédagogique aux modèles de diffusion pour la génération d’images. La progression est logique : du concept de débruitage itératif à l’architecture U-Net, puis à l’alignement texte-image via CLIP, et enfin aux modèles de diffusion latente. L’instructeur utilise des analogies efficaces (comme ’traverser un fossé en deux sauts’) et des démonstrations pratiques avec du code, ce qui facilite la compréhension. La rigueur scientifique est bonne : il cite les papiers originaux (Denoising Diffusion Probabilistic Models, CLIP, Latent Diffusion Models) et explique les intuitions sous-jacentes. Cependant, certaines affirmations sur Sora sont spéculatives, car le rapport technique n’était pas encore publié à l’époque ; il le mentionne d’ailleurs. La partie sur CLIP est bien expliquée, avec la fonction de perte contrastive et l’importance d’éviter l’effondrement du modèle. L’adéquation titre-contenu est parfaite. Le cours est destiné à un public ayant déjà des bases en deep learning, mais il reste accessible. Les démonstrations avec Hugging Face sont pertinentes et montrent l’application pratique. En résumé, un cours de qualité, bien structuré, avec une bonne profondeur technique, même si quelques points restent superficiels (comme les détails de l’architecture U-Net).

189 mots

Adéquation titre / contenu

Le titre est clair et correspond exactement au contenu : présentation des modèles de génération d'images par diffusion conditionnés par du texte.

Qualité & fiabilité

8/10

Cours magistral de niveau universitaire (MIT) par un expert, s'appuyant sur des références académiques (papers originaux) et des démonstrations pratiques. La rigueur est bonne, mais certaines affirmations (ex: sur Sora) sont spéculatives faute de publication officielle.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une explication pédagogique claire des modèles de diffusion, en insistant sur l’intuition derrière le débruitage itératif et l’alignement texte-image via CLIP. Il met en lumière l’importance des connexions résiduelles dans l’architecture U-Net et explique comment les modèles de diffusion latente accélèrent le processus. L’approche est originale dans sa manière de relier les concepts théoriques à des démonstrations pratiques avec Hugging Face.

Pour aller plus loin :

130 mots

Profil radar

Le profil radar montre un bon équilibre entre la quantité d'informations, leur qualité et la fiabilité, avec un niveau technique élevé. La fiabilité globale est légèrement inférieure en raison de quelques spéculations sur Sora.

Fiabilité 8/10