Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 8 - LLM Evaluation

Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 8 - LLM Evaluation

🎙 Afshine Amidi, Shervine Amidi 👥 1.2M 📅 2 décembre 2025 ⏱ 109 min 👁 156K 📄 cours magistral 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

évaluationLLMLLM-as-a-judgebenchmarksbiais

Résumé

Ce cours de la série CME295 de Stanford, donné par Afshine et Shervine Amidi, se concentre sur l’évaluation des grands modèles de langage (LLM). Il commence par rappeler les concepts clés des cours précédents (RAG, tool calling, agents). Ensuite, il aborde les défis de l’évaluation, notamment la subjectivité et le coût des évaluations humaines. Il introduit les métriques d’accord inter-annotateurs comme le coefficient kappa de Cohen, puis les métriques basées sur des règles telles que METEOR, BLEU et ROUGE. La majeure partie du cours est consacrée à la méthode LLM-as-a-judge, qui consiste à utiliser un LLM pour évaluer les réponses d’un autre LLM. Les intervenants détaillent les variantes, les biais (position, verbosité, auto-amélioration) et les bonnes pratiques. Ils abordent également l’évaluation de la factualité, l’évaluation des agents, et présentent plusieurs benchmarks standards : MMLU pour les connaissances, AIME et PIQA pour le raisonnement, SWE-bench pour le codage, HarmBench pour la sécurité, et Tau-Bench pour les agents. Le cours se conclut sur l’importance de choisir les bonnes métriques selon l’usage.

169 mots

Évaluation critique

Ce cours offre une introduction solide et structurée à l’évaluation des LLM, un sujet crucial pour le développement et le déploiement de ces modèles. La valeur pédagogique est indéniable : les explications sont claires, progressives, et illustrées par des exemples concrets. Les intervenants parviennent à vulgariser des concepts complexes sans sacrifier la rigueur technique. La présentation des métriques d’accord inter-annotateurs est particulièrement bien menée, avec une démonstration mathématique simple du problème de l’accord dû au hasard et l’introduction du coefficient kappa de Cohen. La section sur les métriques basées sur des règles (METEOR, BLEU, ROUGE) est concise mais suffisante pour comprendre leur principe et leurs limites. Le cœur du cours, la méthode LLM-as-a-judge, est traité en profondeur : les variantes, les biais (position, verbosité, auto-amélioration) et les bonnes pratiques sont expliqués avec des exemples pertinents. L’accent mis sur les biais est un point fort, car il sensibilise les apprenants aux pièges de cette méthode. La partie sur l’évaluation des agents et les benchmarks (MMLU, AIME, SWE-bench, HarmBench, Tau-Bench) est bien choisie et couvre les principaux domaines d’application. Cependant, on peut regretter que certaines notions soient survolées, comme les détails mathématiques de METEOR ou les spécificités de chaque benchmark. De plus, la vidéo ne cite pas explicitement les sources des benchmarks ou des articles de référence, ce qui limite la vérifiabilité. L’adéquation entre le titre et le contenu est parfaite. En résumé, ce cours est une excellente ressource pour qui veut comprendre les enjeux et les méthodes de l’évaluation des LLM, malgré quelques lacunes en termes de profondeur et de références.

260 mots

Adéquation titre / contenu

Le titre est parfaitement adapté au contenu : il s'agit bien d'un cours sur l'évaluation des LLM, couvrant les méthodes et les benchmarks.

Qualité & fiabilité

8/10

Cours universitaire de niveau master, dispensé par des enseignants de Stanford, avec une structure pédagogique claire, des exemples concrets et des références à des benchmarks standard. La rigueur est bonne, mais certaines parties restent superficielles et les sources ne sont pas systématiquement citées dans la vidéo.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une synthèse claire et structurée des méthodes d’évaluation des LLM, en mettant l’accent sur la méthode LLM-as-a-judge et ses pièges. Il est particulièrement utile pour les praticiens qui cherchent à mettre en place des évaluations robustes. L’originalité réside dans la présentation pédagogique des biais et des bonnes pratiques, ainsi que dans la sélection de benchmarks représentatifs.

Pour aller plus loin :

  • MMLU (Massive Multitask Language Understanding) — Benchmark de référence pour évaluer les connaissances générales des LLM.
  • SWE-bench — Benchmark pour évaluer les capacités de résolution de problèmes de codage.
  • HarmBench — Benchmark pour évaluer la sécurité des LLM face à des attaques adversariales.
  • Tau-Bench — Benchmark pour évaluer les agents conversationnels dans des scénarios réalistes.
  • Coefficient kappa de Cohen — Métrique d’accord inter-annotateurs mentionnée dans le cours.
  • METEOR — Métrique d’évaluation de la traduction automatique.

139 mots

Profil radar

Le profil radar montre une performance équilibrée, avec une légère supériorité en quantité et qualité d'information, ainsi qu'en fiabilité globale. Le niveau technique est élevé, ce qui reflète la nature avancée du cours.

Fiabilité 8/10