AI Red Teaming — Why & How to Jailbreak LLM Agents | Alex Combessie, Giskard l The Next Wave of AI

AI Red Teaming — Why & How to Jailbreak LLM Agents | Alex Combessie, Giskard l The Next Wave of AI

🎙 Alex Combessie 👥 5K 📅 30 octobre 2025 ⏱ 11 min 👁 2K 📄 conférence 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

red teamingjailbreakLLMagentssécurité

Résumé

Cette conférence, donnée par Alex Combessie, cofondateur de Giskard, lors du MLOps World | GenAI Summit 2025, aborde le red teaming appliqué aux agents IA. L’orateur commence par définir le red teaming, issu des exercices militaires, puis explique son importance face aux incidents récents (chatbot DPD, Air Canada, Microsoft Copilot). Il détaille la surface d’attaque des agents LLM, composée de code, de modèles, de garde-fous, de bases de connaissances et d’outils. Il présente ensuite des exemples d’attaques réussies : injection de prompt, hallucinations, et actions non conformes. Il insiste sur la nécessité de tests continus et automatisés, avec une supervision humaine (HITL), et propose des solutions comme des jeux de données d’évaluation et des tableaux de bord. Il mentionne également le standard OWASP Top 10 pour les LLM et les risques spécifiques aux agents. La conférence se conclut par une invitation à explorer des ressources complémentaires.

146 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public professionnel : l’orateur s’appuie sur des exemples concrets et des cas réels, ce qui rend le sujet tangible. L’argumentation est structurée : il part du problème (incidents), explique les causes (surface d’attaque, stochasticité), puis propose des solutions (red teaming continu, automatisation, HITL). Cependant, la démonstration est rapide et certaines affirmations (comme l’inefficacité des garde-fous) mériteraient plus de preuves. La référence à OWASP apporte une crédibilité supplémentaire.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte pour une conférence : l’orateur cite des incidents réels et des standards reconnus (OWASP). Il ne fournit pas de références académiques détaillées, mais son expertise et les exemples concrets renforcent la crédibilité. Le titre est en adéquation avec le contenu, bien que le terme ‘jailbreak’ soit utilisé de manière large. La description fournit des liens vers le site de l’événement, mais pas vers des sources primaires.

161 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : la conférence explique pourquoi et comment effectuer du red teaming sur les agents LLM.

Qualité & fiabilité

7/10

Conférence professionnelle par un expert reconnu, s'appuyant sur des exemples concrets et des références à des standards (OWASP). Les informations sont pratiques et illustrées, mais la démonstration est limitée et certaines affirmations manquent de preuves détaillées.

Moments clés

Sources citées

  • MLOps World — Site de la conférence où la session a été enregistrée

Sources concordantes

Apport & nouveautés

L’apport principal est de mettre en lumière la nécessité de passer d’un test statique à un red teaming continu et automatisé pour les agents LLM, en intégrant une supervision humaine. L’orateur insiste sur les risques spécifiques aux agents (accès aux outils, bases de connaissances) et propose des méthodes concrètes (jeux de données d’évaluation, tableaux de bord).

Pour aller plus loin :

97 mots

Profil radar

Le profil radar montre une bonne couverture des aspects de quantité et qualité de l'information, avec un niveau technique modéré. La fiabilité est correcte, mais la démonstration limitée et le manque de sources détaillées pourraient être améliorés.

Fiabilité 7/10