Stanford CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks

Stanford CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks

🎙 Aakanksha Chowdhery 👥 1.2M 📅 3 août 2026 ⏱ 75 min 👁 267 📄 cours magistral 🧭 2026-08-04
Disponible en : Français (actuel) English

Mots-clés

METRGDPvalDeepScholar-Benchtime horizonagentic evaluation

Résumé

Ce cours de Stanford, donné par Aakanksha Chowdhery, aborde les défis de l’évaluation des agents IA sur des tâches longues et économiquement valorisables. Il présente d’abord la méthodologie de METR, qui mesure le temps de tâche qu’un modèle peut accomplir avec un taux de fiabilité de 50% ou 80%, en s’appuyant sur trois suites de tâches : SWAA (1-30 secondes), HCAST (1 minute à 30 heures) et RE-Bench (jusqu’à 8 heures). Les résultats montrent un doublement de la capacité tous les sept mois, passant de quelques secondes pour GPT-2 en 2019 à près d’une heure pour Claude 3.7 Sonnet en 2025. Ensuite, le cours présente GDPval, un benchmark d’OpenAI qui compare les sorties de modèles à des travaux de professionnels dans 44 métiers, avec des taux de victoire passant de 12,4% pour GPT-4o à 47,6% pour Claude Opus 4.1. Enfin, DeepScholar-Bench, développé à Stanford, évalue la capacité des modèles à générer des sections de revue de littérature, en notant la synthèse des connaissances, la qualité de la récupération et la vérifiabilité des citations. Le cours se conclut sur les modes de défaillance récurrents des agents : mauvaise planification, sélection d’outils inappropriée, abandon prématuré et boucles d’actions répétitives.

197 mots

Évaluation critique

Ce cours offre une vue d’ensemble rigoureuse et actuelle des méthodes d’évaluation des agents IA, avec un accent particulier sur les tâches à long horizon. La présentatrice, Aakanksha Chowdhery, est une chercheuse reconnue, ce qui renforce la crédibilité du contenu. Les benchmarks présentés (METR, GDPval, DeepScholar-Bench) sont récents et pertinents, et les données chiffrées (temps de tâche, taux de réussite) sont précises et bien contextualisées. L’argumentation est solide : elle explique clairement pourquoi les benchmarks traditionnels saturent et pourquoi il est crucial de mesurer la capacité des modèles sur des tâches longues et économiquement valorisables. La méthodologie de METR est bien détaillée, notamment l’utilisation de professionnels expérimentés pour établir des temps de référence humains, et la distinction entre taux de réussite à 50% et 80% est pertinente. Cependant, on peut regretter que certaines limites méthodologiques ne soient pas plus approfondies, comme le biais potentiel des experts qui sous-estiment la difficulté des tâches, ou la question de la généralisabilité des résultats à d’autres domaines que le codage et la recherche. De plus, la vidéo ne fournit pas de détail sur la validation des benchmarks ou sur les éventuelles critiques. L’adéquation entre le titre et le contenu est parfaite, le cours se concentrant exclusivement sur l’évaluation agentique et les tâches à long horizon. Enfin, la qualité des sources est élevée, avec des références à des travaux de METR, OpenAI et Stanford, bien que les liens directs ne soient pas fournis dans la description. Dans l’ensemble, ce cours est une excellente ressource pour comprendre les enjeux de l’évaluation des agents IA, avec une rigueur scientifique appréciable.

263 mots

Adéquation titre / contenu

Le titre décrit précisément le contenu : évaluations agentiques et tâches à long horizon.

Qualité & fiabilité

8/10

Cours universitaire de Stanford, présenté par une chercheuse reconnue, s'appuyant sur des benchmarks récents (METR, GDPval, DeepScholar-Bench) et des données chiffrées. La rigueur est élevée, mais certaines affirmations ne sont pas détaillées dans la vidéo.

Moments clés

Sources citées

Sources concordantes

  • METR — Site officiel de METR, qui publie des analyses sur les capacités des modèles.
  • GDPval — Article d'OpenAI présentant le benchmark GDPval.
  • DeepScholar-Bench — Site du benchmark DeepScholar-Bench de Stanford.

Apport & nouveautés

Ce cours apporte une synthèse actualisée des méthodes d’évaluation des agents IA, en mettant l’accent sur les tâches longues et économiquement valorisables. Il présente des benchmarks récents (METR, GDPval, DeepScholar-Bench) et leurs résultats chiffrés, offrant une perspective concrète sur la progression des capacités des modèles. L’originalité réside dans la mise en parallèle de ces approches et l’identification des facteurs clés de l’amélioration (raisonnement, génération de code, etc.).

Pour aller plus loin :

  • METR — Organisation à l’origine de la méthodologie de time horizon, site officiel.
  • GDPval — Article d’OpenAI présentant le benchmark GDPval.
  • DeepScholar-Bench — Site du benchmark DeepScholar-Bench de Stanford.
  • SWE-bench — Benchmark de référence pour les tâches de génie logiciel.
  • RE-Bench — Référentiel du benchmark RE-Bench sur GitHub.

120 mots

Profil radar

Le profil radar montre une bonne couverture sur tous les axes, avec une légère prédominance de la fiabilité et de la qualité de l'information, reflétant un contenu académique solide et bien structuré.

Fiabilité 8/10