Building Conversational AI Agents with Thread-Level Eval Metrics

Building Conversational AI Agents with Thread-Level Eval Metrics

🎙 Tony Kipkemboi & Claire Longo 👥 5K 📅 23 octobre 2025 ⏱ 75 min 👁 63 📄 tutoriel 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

agent conversationnelévaluationLLM-as-a-Judgeorchestrationproduction

Résumé

Cette session, enregistrée lors du MLOps World | GenAI Summit 2025, présente un cadre pratique pour construire et évaluer des agents conversationnels en production. Tony Kipkemboi (CrewAI) introduit les concepts d’agents, de tâches, de crews et de flows, en utilisant une analogie avec une entreprise. Claire Longo (Comet) présente ensuite Opik, un outil open source pour l’observabilité et l’évaluation des applications LLM. L’atelier se concentre sur la mise en place d’un chatbot de support client avec une architecture multi-agents. Le flux comprend l’ingestion de tickets, la classification de l’intention, le routage vers des crews spécialisés (technique, escalade, facturation, chat) et l’archivage. L’évaluation est réalisée via des métriques personnalisées utilisant LLM-as-a-Judge et des retours humains. Les intervenants montrent comment configurer Opik pour tracer les interactions, appliquer des métriques d’évaluation et intégrer le feedback humain. Ils soulignent l’importance de l’observabilité pour détecter les défaillances en production, illustrées par des exemples concrets (chatbot Chevrolet, drive-thru McDonald’s). La session se termine par une démonstration pratique dans un notebook Google Colab, où les participants peuvent suivre et exécuter le code.

175 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens souhaitant implémenter des agents conversationnels avec une évaluation robuste. Les intervenants fournissent des explications claires sur l’architecture multi-agents et l’évaluation au niveau du fil de discussion, une approche plus holistique que l’évaluation au niveau des traces. L’argumentation s’appuie sur des exemples concrets d’échecs en production pour justifier la nécessité de l’observabilité et des métriques personnalisées. La démonstration pratique renforce la crédibilité, mais la session reste un atelier et ne présente pas de résultats quantitatifs comparant les approches.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte pour un atelier technique. Les intervenants citent des exemples réels de défaillances d’IA, mais sans références académiques. Les sources mentionnées sont principalement les documentations de CrewAI et Comet Opik, ainsi que le site de la conférence. L’adéquation titre/contenu est bonne : le titre reflète précisément le sujet. Aucun commentaire n’est fourni pour analyser les tendances du public.

163 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : la session porte sur la construction d'agents conversationnels avec des métriques d'évaluation au niveau du fil de discussion.

Qualité & fiabilité

7/10

Présentation technique de deux outils open source (CrewAI, Comet Opik) avec démonstration pratique. Les intervenants sont des experts reconnus dans le domaine. Les concepts sont expliqués clairement, mais la session est un atelier et ne fournit pas de preuves empiriques de l'efficacité des méthodes. Les sources citées se limitent aux sites des outils et à la conférence.

Moments clés

Sources citées

Sources concordantes

  • CrewAI Documentation — Documentation officielle de CrewAI, mentionnée par Tony Kipkemboi.
  • Comet Opik — Site officiel d'Opik, présenté par Claire Longo.

Apport & nouveautés

L’apport principal est la démonstration d’un cadre pratique combinant orchestration multi-agents (CrewAI) et évaluation au niveau du fil de discussion (Comet Opik). L’accent mis sur l’évaluation au niveau du fil plutôt que sur les traces individuelles est une avancée pour la fiabilité des agents conversationnels. La session fournit un template réutilisable pour construire un chatbot de support client avec des métriques personnalisées.

Pour aller plus loin :

  • LLM-as-a-Judge — Article fondateur sur l’utilisation de LLM comme juges pour l’évaluation.
  • CrewAI Documentation — Documentation officielle de CrewAI.
  • Comet Opik — Site officiel d’Opik, outil d’évaluation et d’observabilité.

96 mots

Profil radar

Le profil radar montre des scores élevés en quantité d'information et en niveau technique, reflétant la richesse du contenu et la profondeur technique. La qualité de l'information et la fiabilité globale sont légèrement inférieures, en raison du format atelier et du manque de références académiques.

Fiabilité 7/10