Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 3 - Tranformers & Large Language Models

Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 3 - Tranformers & Large Language Models

🎙 Afshine Amidi et Shervine Amidi 👥 1.2M 📅 17 octobre 2025 ⏱ 108 min 👁 114K 📄 cours magistral 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

LLMMoEtemperaturesamplingchain-of-thought

Résumé

Ce troisième cours du programme CME295 de Stanford, intitulé ‘Transformers & Large Language Models’, est présenté par Afshine et Shervine Amidi. Il débute par un rappel des trois grandes familles de modèles basés sur le transformateur : encodeur-décodeur (T5), encodeur seul (BERT) et décodeur seul (GPT). Les LLM sont ensuite définis comme des modèles de langage de grande taille, typiquement des décodeurs seuls, entraînés sur des centaines de milliards de paramètres et des billions de jetons. Le cours aborde en détail le concept de Mixture of Experts (MoE), en distinguant les variantes denses et éparses, et explique comment cette technique permet de réduire les coûts de calcul en n’activant qu’un sous-ensemble d’experts. La seconde partie est consacrée aux stratégies de génération de texte : décodage glouton, beam search, méthodes d’échantillonnage (top-k, top-p), et l’impact de la température sur la diversité des sorties. Les techniques de prompting sont ensuite présentées, notamment l’in-context learning, le chain-of-thought et la self-consistency. Enfin, le cours se termine par des optimisations d’inférence telles que le KV cache, PagedAttention et MLA. L’ensemble est illustré par des exemples concrets et des analogies pédagogiques, et s’appuie sur des ressources complémentaires disponibles sur le site du cours.

197 mots

Évaluation critique

Ce cours magistral de Stanford offre une introduction solide et structurée aux grands modèles de langage. La valeur pédagogique est indéniable : les explications sont claires, progressives et s’appuient sur des analogies efficaces (comme la métaphore des experts pour les MoE). La rigueur scientifique est exemplaire : les concepts sont définis avec précision, les formules sont présentées et les implications pratiques sont discutées. Les intervenants, Afshine et Shervine Amidi, sont des experts reconnus dans le domaine, ce qui renforce la crédibilité du contenu. Les sources citées, bien que peu nombreuses dans la vidéo elle-même, sont complétées par les ressources du syllabus en ligne. L’argumentation est solide, chaque concept étant introduit par une question ou un problème concret, puis résolu par une explication théorique et des exemples. La qualité des sources est bonne, mais on peut regretter l’absence de références bibliographiques explicites dans la vidéo. L’adéquation entre le titre et le contenu est parfaite : le cours couvre bien les Transformers et les LLM, avec une progression logique. Le niveau technique est élevé, mais accessible à un public ayant des bases en apprentissage automatique. On peut noter quelques points faibles : la partie sur les MoE est très détaillée, mais la partie sur les stratégies de prompting aurait pu être approfondie. De plus, la transcription contient des erreurs de transcription (par exemple, ‘Guan’ au lieu de ‘Qwen’), mais cela n’affecte pas la compréhension. Dans l’ensemble, ce cours est une excellente ressource pour quiconque souhaite comprendre les fondements des LLM, et il mérite une note maximale.

254 mots

Adéquation titre / contenu

Le titre décrit précisément le contenu : il s'agit bien du troisième cours sur les Transformers et les LLM, couvrant les architectures, les stratégies de génération et d'inférence.

Qualité & fiabilité

9/10

Cours magistral de niveau universitaire (Stanford) dispensé par des experts reconnus, avec une structure pédagogique claire, des explications précises et des références à des ressources académiques. La fiabilité est excellente, bien que le contenu soit une introduction et ne couvre pas tous les aspects avancés.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une synthèse pédagogique claire et actualisée des concepts clés des LLM, en mettant l’accent sur les aspects pratiques de l’inférence et de l’optimisation. Il se distingue par une explication détaillée des Mixture of Experts et des stratégies de génération, souvent peu couvertes dans les introductions. L’apport original réside dans la structuration progressive et les analogies intuitives qui facilitent la compréhension de sujets complexes.

Pour aller plus loin :

118 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés, avec une légère prédominance de la quantité d'information et de la fiabilité. Cela indique un contenu dense, fiable et techniquement solide, bien adapté à un public étudiant ou professionnel.

Fiabilité 9/10