Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 6 - LLM Reasoning

Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 6 - LLM Reasoning

🎙 Afshine Amidi, Shervine Amidi 👥 1.2M 📅 14 novembre 2025 ⏱ 107 min 👁 71K 📄 cours magistral 🧭 2026-08-05
Disponible en : Français (actuel) English

Mots-clés

reasoning modelsreinforcement learningGRPOPPOchain-of-thought

Résumé

Ce cours de Stanford CME295, donné par Afshine et Shervine Amidi, est consacré au raisonnement des grands modèles de langage (LLM). Après un rappel des étapes de pré-entraînement, de fine-tuning et d’alignement par préférences (RLHF), les intervenants introduisent la notion de raisonnement comme la capacité à résoudre des problèmes multi-étapes, souvent mathématiques ou de codage. Ils expliquent que les LLM classiques, entraînés par prédiction du prochain token, ont des capacités de raisonnement limitées. Pour y remédier, ils présentent les modèles de raisonnement, qui génèrent une chaîne de pensée (chain-of-thought) avant la réponse finale. La formation de ces modèles repose sur l’apprentissage par renforcement (RL) avec des récompenses basées sur la correction des réponses. Le cours détaille les métriques d’évaluation comme Pass@k, puis les algorithmes d’optimisation : PPO (Proximal Policy Optimization) et GRPO (Group Relative Policy Optimization), en comparant leurs avantages. Il aborde également les problèmes de biais de longueur, et des améliorations comme DAPO et Dr. GRPO. Enfin, il présente la recette de DeepSeek R1, un modèle de raisonnement open-source, illustrant les principes discutés. Le cours se conclut sur l’importance du scaling et des données de qualité pour améliorer le raisonnement.

191 mots

Évaluation critique

Ce cours magistral de Stanford offre une introduction rigoureuse et à jour aux modèles de raisonnement pour les LLM. La valeur pédagogique est élevée : les concepts sont expliqués de manière progressive, avec des rappels utiles des cours précédents. La structure est claire, passant de la définition du raisonnement à la présentation des méthodes d’entraînement, puis aux détails algorithmiques. Les intervenants, Afshine et Shervine Amidi, sont des experts reconnus dans le domaine, ce qui renforce la crédibilité du contenu. Les explications sont précises et s’appuient sur des travaux récents (2024-2025), notamment DeepSeek R1, ce qui montre une bonne actualisation des connaissances. L’argumentation est solide : ils justifient l’importance du RL pour le raisonnement, comparent PPO et GRPO, et discutent des limites comme le biais de longueur. Les sources sont principalement des références académiques et des travaux de recherche, bien que le cours ne cite pas explicitement toutes les publications. La qualité des sources est donc bonne, mais on pourrait regretter l’absence de citations formelles dans la vidéo. L’adéquation entre le titre et le contenu est parfaite : le cours couvre bien le raisonnement des LLM. La note globale de 5 étoiles se justifie par la clarté, la profondeur et la pertinence du contenu. Cependant, on peut noter que le cours est destiné à un public ayant déjà des bases en apprentissage automatique, ce qui n’est pas un défaut en soi. En résumé, c’est une excellente ressource pour comprendre les modèles de raisonnement et leur entraînement.

245 mots

Adéquation titre / contenu

Le titre décrit exactement le contenu : une leçon sur le raisonnement des LLM, couvrant les modèles, les benchmarks, et les méthodes d'entraînement par RL.

Qualité & fiabilité

9/10

Cours universitaire de Stanford, présenté par des experts reconnus, s'appuyant sur des travaux récents et des références académiques. Le contenu est structuré, précis et didactique, avec une mise en perspective critique des méthodes.

Chapitres

Sources citées

Sources concordantes

Sources discordantes

  • Aucune source discordante identifiée — Le cours ne présente pas de controverses majeures ; les méthodes sont généralement acceptées dans la communauté.

Apport & nouveautés

Ce cours apporte une synthèse claire et actualisée des méthodes de raisonnement pour les LLM, en particulier l’utilisation du RL et de l’algorithme GRPO. Il met en lumière les évolutions récentes comme DeepSeek R1 et discute des défis pratiques (biais de longueur, stabilité). L’apport original réside dans la comparaison détaillée entre PPO et GRPO, et l’explication des variantes comme DAPO et Dr. GRPO.

Pour aller plus loin :

158 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité, avec un niveau technique légèrement inférieur mais toujours solide. Cela indique un contenu dense, fiable et accessible à un public averti.

Fiabilité 9/10