Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL

Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL

🎙 Aakanksha Chowdhery 👥 1.2M 📅 3 août 2026 ⏱ 72 min 👁 934 📄 cours magistral 🧭 2026-08-04
Disponible en : Français (actuel) English

Mots-clés

train-time scalingreinforcement learningSTaRDeepSeekMathDAPO

Résumé

Ce sixième cours de la série CS329A de Stanford, donné par Aakanksha Chowdhery, explore le scaling du temps d’entraînement (train-time scaling) et le scaling du reinforcement learning (RL) pour améliorer les capacités de raisonnement des modèles de langage. L’objectif est de montrer comment des modèles plus petits peuvent atteindre des performances comparables à des modèles beaucoup plus grands sur des benchmarks de raisonnement mathématique comme AIME. Trois articles sont présentés : STaR (Self-Taught Reasoner) qui bootstrap le raisonnement en générant des chaînes de raisonnement et en les filtrant par exactitude ; DeepSeekMath qui introduit l’optimisation de politique relative de groupe (GRPO), une alternative efficace en mémoire à PPO, et montre des gains sur des données mathématiques ; et DAPO qui traite de l’instabilité d’entraînement en RL sur de longues chaînes de raisonnement, avec des techniques comme le clipping asymétrique et l’échantillonnage dynamique. La conférencière souligne l’importance de la vérifiabilité des domaines (mathématiques, code) pour que ces méthodes fonctionnent, et discute des questions ouvertes comme la différence entre pass@K et majority@K. Le cours se conclut sur des questions ouvertes et des perspectives pour la suite.

184 mots

Évaluation critique

Cette conférence de Stanford offre une introduction solide et pédagogique au train-time scaling, un sujet crucial pour l’amélioration des modèles de langage. La présentatrice, Aakanksha Chowdhery, est une experte reconnue, ayant dirigé l’entraînement de modèles de pointe comme PaLM et Gemini, ce qui confère une crédibilité certaine à son exposé. La structure est claire : elle commence par motiver le sujet avec le benchmark AIME, puis présente trois articles fondateurs (STaR, DeepSeekMath, DAPO) en expliquant leurs contributions et leurs limites. L’accent mis sur les détails d’implémentation et les pièges du RL est particulièrement pertinent, car ces aspects sont souvent négligés dans les présentations généralistes. La discussion sur la vérifiabilité des domaines est également bien amenée, soulignant que ces techniques ne sont efficaces que lorsque l’on peut vérifier les réponses. Cependant, on peut regretter que la conférence reste à un niveau relativement élevé et ne fournisse pas d’exemples concrets de code ou d’expériences détaillées. De plus, certaines affirmations, comme l’efficacité supérieure du test-time scaling, sont nuancées mais pas toujours approfondies. Les sources citées sont pertinentes et les liens vers les ressources du cours sont utiles. Dans l’ensemble, il s’agit d’un contenu de qualité, bien adapté à un public ayant déjà des bases en apprentissage automatique, et qui offre une bonne synthèse des approches actuelles pour améliorer le raisonnement des modèles.

219 mots

Adéquation titre / contenu

Le titre est clair et correspond exactement au contenu : il s'agit de la sixième partie du cours, dédiée au scaling du temps d'entraînement et au scaling du RL.

Qualité & fiabilité

8/10

Cours universitaire de Stanford, présenté par une chercheuse reconnue, s'appuyant sur des publications scientifiques majeures (STaR, DeepSeekMath, DAPO). Les explications sont rigoureuses et les références sont citées, mais le format de cours magistral limite la profondeur critique.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Cette conférence apporte une synthèse claire et structurée des méthodes de train-time scaling, en les reliant à des articles de recherche récents. Elle met en lumière l’importance des détails d’implémentation dans le RL et propose une perspective unifiée sur la manière d’améliorer les capacités de raisonnement des modèles. L’accent mis sur la vérifiabilité comme condition préalable est un point de vue pertinent.

Pour aller plus loin :

135 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés sur les quatre axes, indiquant une conférence dense et fiable, avec un bon niveau technique et une quantité d'information substantielle. La fiabilité globale est renforcée par la crédibilité de l'intervenante et la qualité des sources.

Fiabilité 8/10