Managing AI Agent Performance Degradation in Production | Kumaran Ponnambalam, Cisco

Managing AI Agent Performance Degradation in Production | Kumaran Ponnambalam, Cisco

🎙 Kumaran Ponnambalam 👥 5K 📅 24 octobre 2025 ⏱ 28 min 👁 132 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

agent driftdérive de modèleobservabilitéretrainingproduction

Résumé

Cette présentation, enregistrée lors du MLOps World | GenAI Summit 2025, aborde la problématique de la dégradation de performance des agents IA en production, concept nommé ‘agent drift’. L’orateur, Kumaran Ponnambalam, ingénieur principal en IA chez Cisco, partage son expérience au sein de l’équipe Customer Experience (CX) qui a déployé plus de 100 agents. Il distingue l’agent drift du drift classique en ML, en soulignant que les agents sont affectés par des variables externes supplémentaires : le but de l’utilisateur (goal drift), le contexte dynamique (context drift), le modèle sous-jacent (reasoning drift) et les outils/agents (collaboration drift). Il présente des méthodes de mesure : comparaison de distributions via tests statistiques (chi², KS) et analyse de pentes sur des métriques agrégées. Il détaille les causes racines observées (mismatch évaluation/production, changements silencieux dans les systèmes externes, mises à jour de modèles, modifications d’instructions, etc.) et propose des bonnes pratiques : évaluations rigoureuses, calibration continue, versioning des API, contrôles stricts des entrées/sorties, ingénierie de contexte, expérimentation des seuils, formation des utilisateurs et traçabilité. Il conclut sur l’importance de la résilience des agents face aux changements externes.

183 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur de cette présentation réside dans son ancrage pratique : l’orateur s’appuie sur une expérience réelle de déploiement à grande échelle chez Cisco, ce qui donne des exemples concrets (comme l’agent de renouvellement) et des leçons apprises. L’argumentation est structurée et progressive : définition du problème, identification des variables, méthodes de mesure, résultats, causes racines, bonnes pratiques. L’orateur justifie ses choix par des considérations opérationnelles (volume de données, seuils, saisonnalité) et reconnaît les limites (seuils difficiles à déterminer, contexte drift encore en cours). Cependant, la présentation reste qualitative : peu de chiffres précis, pas de comparaison avec d’autres approches, et certaines affirmations (comme l’efficacité des tests statistiques) ne sont pas étayées par des données détaillées. La solidité de l’argumentation est bonne pour un retour d’expérience, mais elle ne constitue pas une démonstration scientifique rigoureuse.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : l’orateur cite des concepts classiques (tests statistiques, seuils) et mentionne l’outil open-source Arize Phoenix, mais sans fournir de références bibliographiques précises. La qualité des sources est donc limitée à l’expérience personnelle et à des références générales. L’adéquation titre/contenu est bonne : le titre annonce la gestion de la dégradation de performance des agents IA, ce qui correspond au contenu. La présentation est cohérente et bien structurée, mais elle manque de références externes pour étayer les affirmations. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

247 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : il annonce la gestion de la dégradation de performance des agents IA en production, et l'exposé traite précisément de ce sujet.

Qualité & fiabilité

7/10

Exposé d'un praticien expérimenté (Principal AI Engineer chez Cisco) présentant des méthodes concrètes et des retours d'expérience issus d'un déploiement à grande échelle (100+ agents). Les techniques s'appuient sur des concepts classiques du ML (tests statistiques, seuils) et des outils open-source (Arize Phoenix). Toutefois, la présentation reste une synthèse d'expérience sans publication scientifique formelle ni données quantitatives détaillées, ce qui limite la vérifiabilité.

Moments clés

Sources citées

Sources concordantes

  • Arize Phoenix — Outil open-source d'observabilité pour LLM, mentionné par l'orateur comme source de métriques.

Apport & nouveautés

L’apport principal est la formalisation du concept d’agent drift et la proposition d’un cadre pour le mesurer et le gérer, basé sur une expérience industrielle à grande échelle. L’orateur distingue plusieurs types de drift (goal, context, reasoning, collaboration) et propose des méthodes concrètes (tests statistiques, analyse de pentes) adaptées aux agents. Il partage également des bonnes pratiques opérationnelles issues de son expérience chez Cisco.

Pour aller plus loin :

  • Concept drift — Notion classique de dérive de concept en apprentissage automatique, à la base de l’agent drift.
  • Test du khi-deux — Test statistique utilisé pour comparer les distributions.
  • Test de Kolmogorov-Smirnov — Test non paramétrique pour comparer deux distributions.
  • Arize Phoenix — Framework open-source d’observabilité pour LLM, mentionné par l’orateur comme outil de mesure.
  • MLOps — Pratiques d’ingénierie pour déployer et maintenir des modèles en production.

136 mots

Profil radar

Le profil radar montre des scores élevés en quantité d'information et niveau technique, reflétant une présentation dense et spécialisée. La qualité de l'information et la fiabilité globale sont légèrement inférieures, indiquant que l'exposé est basé sur l'expérience plutôt que sur des preuves formelles.

Fiabilité 7/10