
Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 8 - LLM Evaluation
Mots-clés
Résumé
169 mots
Évaluation critique
Ce cours offre une introduction solide et structurée à l’évaluation des LLM, un sujet crucial pour le développement et le déploiement de ces modèles. La valeur pédagogique est indéniable : les explications sont claires, progressives, et illustrées par des exemples concrets. Les intervenants parviennent à vulgariser des concepts complexes sans sacrifier la rigueur technique. La présentation des métriques d’accord inter-annotateurs est particulièrement bien menée, avec une démonstration mathématique simple du problème de l’accord dû au hasard et l’introduction du coefficient kappa de Cohen. La section sur les métriques basées sur des règles (METEOR, BLEU, ROUGE) est concise mais suffisante pour comprendre leur principe et leurs limites. Le cœur du cours, la méthode LLM-as-a-judge, est traité en profondeur : les variantes, les biais (position, verbosité, auto-amélioration) et les bonnes pratiques sont expliqués avec des exemples pertinents. L’accent mis sur les biais est un point fort, car il sensibilise les apprenants aux pièges de cette méthode. La partie sur l’évaluation des agents et les benchmarks (MMLU, AIME, SWE-bench, HarmBench, Tau-Bench) est bien choisie et couvre les principaux domaines d’application. Cependant, on peut regretter que certaines notions soient survolées, comme les détails mathématiques de METEOR ou les spécificités de chaque benchmark. De plus, la vidéo ne cite pas explicitement les sources des benchmarks ou des articles de référence, ce qui limite la vérifiabilité. L’adéquation entre le titre et le contenu est parfaite. En résumé, ce cours est une excellente ressource pour qui veut comprendre les enjeux et les méthodes de l’évaluation des LLM, malgré quelques lacunes en termes de profondeur et de références.
260 mots
Adéquation titre / contenu
Le titre est parfaitement adapté au contenu : il s'agit bien d'un cours sur l'évaluation des LLM, couvrant les méthodes et les benchmarks.
Qualité & fiabilité
8/10
Cours universitaire de niveau master, dispensé par des enseignants de Stanford, avec une structure pédagogique claire, des exemples concrets et des références à des benchmarks standard. La rigueur est bonne, mais certaines parties restent superficielles et les sources ne sont pas systématiquement citées dans la vidéo.
Chapitres
- Introduction
- Inter-rater agreement metrics
- Rule-based metrics
- METEOR, BLEU ROUGE
- LLM-as-a-judge
- Structured outputs
- Variants
- Position, verbosity, self-enhancement bias
- Best practices
- Factuality
- Agent evaluation
- Benchmarks
- Knowledge with MMLU
- Reasoning AIME, PIQA
- Coding with SWE-bench
- Safety with HarmBench
- Agents with Tau-Bench
Sources citées
- Syllabus du cours CME295 — Lien fourni dans la description pour suivre le programme du cours.
- Page des programmes diplômants de Stanford Online — Lien fourni dans la description pour plus d'informations sur les programmes de Stanford.
- Playlist du cours CME295 — Lien vers la playlist complète des vidéos du cours.
Sources concordantes
- MMLU: Massive Multitask Language Understanding — Benchmark mentionné dans le cours pour évaluer les connaissances.
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? — Benchmark mentionné dans le cours pour évaluer le codage.
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal — Benchmark mentionné dans le cours pour évaluer la sécurité.
- Tau-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains — Benchmark mentionné dans le cours pour évaluer les agents.
Apport & nouveautés
Ce cours apporte une synthèse claire et structurée des méthodes d’évaluation des LLM, en mettant l’accent sur la méthode LLM-as-a-judge et ses pièges. Il est particulièrement utile pour les praticiens qui cherchent à mettre en place des évaluations robustes. L’originalité réside dans la présentation pédagogique des biais et des bonnes pratiques, ainsi que dans la sélection de benchmarks représentatifs.
Pour aller plus loin :
- MMLU (Massive Multitask Language Understanding) — Benchmark de référence pour évaluer les connaissances générales des LLM.
- SWE-bench — Benchmark pour évaluer les capacités de résolution de problèmes de codage.
- HarmBench — Benchmark pour évaluer la sécurité des LLM face à des attaques adversariales.
- Tau-Bench — Benchmark pour évaluer les agents conversationnels dans des scénarios réalistes.
- Coefficient kappa de Cohen — Métrique d’accord inter-annotateurs mentionnée dans le cours.
- METEOR — Métrique d’évaluation de la traduction automatique.
139 mots
Profil radar
Le profil radar montre une performance équilibrée, avec une légère supériorité en quantité et qualité d'information, ainsi qu'en fiabilité globale. Le niveau technique est élevé, ce qui reflète la nature avancée du cours.