Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents

Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents

🎙 Aakanksha Chowdhery 👥 1.2M 📅 3 août 2026 ⏱ 72 min 👁 1K 📄 cours magistral 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

AlphaCodeAlphaCode2Search-O1Search-R1échantillonnage

Résumé

Ce cours de la série CS329A de Stanford, donné par Aakanksha Chowdhery, explore les mécanismes d’auto-amélioration des modèles de langage par recherche. La première partie se concentre sur AlphaCode, un système de résolution de problèmes de programmation compétitive. AlphaCode pré-entraîne un modèle masqué sur GitHub et CodeContests, puis génère un million de solutions par problème, les filtre et les regroupe pour sélectionner les plus prometteuses, avant de les soumettre à la plateforme Codeforces. Le cours détaille les étapes de pré-entraînement, de fine-tuning avec régularisation GOLD, et l’importance du clustering pour la diversité. Il montre comment la performance évolue avec le nombre d’échantillons et discute des goulots d’étranglement de la sélection. La deuxième partie introduit Search-O1, une méthode qui déclenche des recherches documentaires lorsque le modèle exprime une incertitude, améliorant les performances sur des benchmarks comme GPQA et HotpotQA. Enfin, la comparaison avec Search-R1, basé sur l’apprentissage par renforcement, illustre deux approches pour apprendre quand chercher. Le cours souligne que les solutions existent dans l’espace de recherche du modèle, mais que la curation est cruciale.

174 mots

Évaluation critique

Le cours offre une analyse approfondie et rigoureuse des techniques d’auto-amélioration par recherche, s’appuyant sur des travaux de recherche majeurs et récents. La présentation est claire, structurée et technique, adaptée à un public averti. Les explications sur AlphaCode sont détaillées, couvrant les aspects de pré-entraînement, de fine-tuning, d’échantillonnage massif, de filtrage et de clustering. L’accent mis sur les goulots d’étranglement de la sélection et l’impact de la taille du modèle est pertinent et montre une compréhension fine des enjeux. La discussion sur Search-O1 et Search-R1 est également solide, bien que plus brève. La qualité des sources est excellente, les travaux cités étant publiés par des équipes de recherche de premier plan (DeepMind, Google, etc.). L’argumentation est solide, appuyée par des résultats expérimentaux. L’adéquation entre le titre et le contenu est parfaite. On peut toutefois noter que le cours ne couvre pas en détail les aspects pratiques de mise en œuvre, et que certaines parties, comme la comparaison entre Search-O1 et Search-R1, auraient pu être approfondies. De plus, la vidéo ne fournit pas de démonstration concrète, ce qui peut limiter la compréhension pour certains. Dans l’ensemble, il s’agit d’un contenu de très haute qualité, à la pointe de la recherche en IA, qui constitue une ressource précieuse pour les étudiants et les chercheurs.

212 mots

Adéquation titre / contenu

Le titre est exact : le cours couvre bien l'auto-amélioration par recherche, avec des exemples concrets (AlphaCode, Search-O1) et une introduction aux agents de recherche profonde.

Qualité & fiabilité

8/10

Cours magistral de niveau universitaire (Stanford) dispensé par une chercheuse reconnue, s'appuyant sur des publications scientifiques majeures (AlphaCode, AlphaCode2, Search-O1, Search-R1). Les explications sont précises et techniques, avec des références aux travaux originaux. La fiabilité est élevée, mais la présentation reste une synthèse pédagogique et non une revue exhaustive.

Moments clés

Sources citées

Sources concordantes

  • AlphaCode paper — Confirme les détails techniques d'AlphaCode présentés dans le cours.
  • Search-O1 paper — Confirme les performances de Search-O1 sur GPQA et HotpotQA.

Apport & nouveautés

Ce cours apporte une synthèse claire et actualisée des techniques d’auto-amélioration par recherche, en reliant des travaux majeurs comme AlphaCode, AlphaCode2, Search-O1 et Search-R1. Il met en lumière les défis de la sélection et du clustering dans les pipelines d’échantillonnage massif, et compare les approches par prompting et par apprentissage par renforcement pour décider quand chercher. L’apport original réside dans la perspective pédagogique qui relie ces méthodes à des applications pratiques (agents de recherche profonde).

Pour aller plus loin :

  • AlphaCode paper — Article original d’AlphaCode, détaillant l’architecture et les résultats.
  • AlphaCode2 paper — Article sur AlphaCode2, avec l’utilisation de Gemini Pro et du modèle de scoring.
  • Search-O1 paper — Article présentant Search-O1, la méthode de recherche déclenchée par l’incertitude.
  • Search-R1 paper — Article sur Search-R1, l’approche par apprentissage par renforcement.
  • GPQA benchmark — Benchmark de questions de niveau graduate, utilisé pour évaluer Search-O1.
  • HotpotQA — Benchmark de questions-réponses multi-hop, mentionné dans le cours.

154 mots

Profil radar

Le profil radar montre un contenu très équilibré, avec une excellente qualité d'information et un niveau technique élevé, mais une quantité d'information légèrement inférieure en raison de la durée limitée. La fiabilité est très bonne, soutenue par des sources académiques solides.

Fiabilité 8/10