[M2L 2025] 1.4 LLM Evaluation - Emine Yilmaz

[M2L 2025] 1.4 LLM Evaluation - Emine Yilmaz

🎙 Emine Yilmaz 👥 3K 📅 10 novembre 2025 ⏱ 65 min 👁 109 📄 revue de littérature 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

évaluationLLMmétriqueshallucinationbiais

Résumé

Cette présentation d’Emine Yilmaz, donnée dans le cadre de la summer school M2L 2025, est consacrée à l’évaluation des grands modèles de langage (LLM). L’oratrice commence par justifier l’importance de l’évaluation, souvent perçue comme un problème secondaire, en soulignant qu’elle est essentielle pour l’amélioration des modèles et la prévention de problèmes tels que la désinformation, les biais et les sorties dangereuses. Elle distingue deux grandes familles de métriques : les métriques quantitatives, comme l’exactitude, BLEU, ROUGE et la perplexité, qui nécessitent une référence, et les métriques qualitatives, qui évaluent des dimensions comme la fluidité, la cohérence, la factualité, l’équité, la sécurité et l’alignement. Elle insiste sur le fait que ces dimensions ne sont pas exhaustives et dépendent de la tâche. Ensuite, elle aborde les méthodes d’évaluation, notamment l’annotation humaine, le crowdsourcing, la vérification des faits avec des sources externes, et l’évaluation contrefactuelle pour les biais. Elle introduit le paradigme du ‘LLM-as-a-judge’, qui utilise un modèle de langage pour évaluer les sorties d’un autre modèle, en soulignant ses avantages en termes de coût, de rapidité et de flexibilité, mais aussi ses limites, comme la sensibilité aux paraphrases du prompt et les biais potentiels. Elle présente des travaux de recherche sur l’optimisation des prompts pour les juges LLM, l’utilisation de RAG pour fournir des connaissances externes, et l’émergence d’agents comme juges. La présentation se conclut sur l’importance de l’évaluation pour un développement responsable de l’IA.

233 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : la conférencière, experte reconnue dans le domaine, offre une synthèse claire et structurée des concepts clés de l’évaluation des LLM, allant des métriques classiques aux approches modernes comme le LLM-as-a-judge. L’argumentation est solide, appuyée par des exemples concrets et des références à des travaux de recherche. Elle souligne à juste titre les limites des métriques quantitatives et la nécessité d’une évaluation multidimensionnelle. La présentation est bien organisée, avec une progression logique et des transitions claires.

89 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : il s'agit bien d'une présentation sur l'évaluation des LLM.

Qualité & fiabilité

8/10

Exposé structuré et pédagogique par une chercheuse reconnue, couvrant les métriques classiques et les dimensions qualitatives de l'évaluation des LLM, avec des références à des travaux de recherche. Quelques imprécisions dans la transcription (ex. 'blow' pour 'BLEU') mais le contenu reste fiable.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

La présentation offre une synthèse claire et à jour des méthodes d’évaluation des LLM, en insistant sur l’importance de l’évaluation pour le développement de modèles fiables et responsables. Elle met en lumière les limites des métriques traditionnelles et l’émergence de nouvelles approches comme le LLM-as-a-judge, avec ses avantages et ses défis. L’accent mis sur les dimensions qualitatives et la robustesse est particulièrement pertinent.

Pour aller plus loin :

  • LLM-as-a-judge — Étude de référence sur les biais et la fiabilité des juges LLM.
  • Hallucination in LLMs — Revue des travaux sur les hallucinations, un problème clé mentionné dans la vidéo.
  • RAG for evaluation — Article fondateur sur le RAG, utilisé pour fournir des connaissances externes aux juges LLM.

117 mots

Profil radar

Le profil radar montre une bonne maîtrise du sujet avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est également solide, indiquant une présentation adaptée à un public averti.

Fiabilité 8/10