Attacking AI - Jason Haddix - NDC Security 2026

Attacking AI - Jason Haddix - NDC Security 2026

🎙 Jason Haddix 👥 227K 📅 26 mars 2026 ⏱ 55 min 👁 66K 📄 conférence technique 🧭 2026-08-13
Disponible en : Français (actuel) English

Mots-clés

IAsécuritéprompt injectionred teamméthodologie

Résumé

Jason Haddix, expert en sécurité offensive avec plus de 20 ans d’expérience, présente une méthodologie pour évaluer la sécurité des systèmes basés sur l’IA. Il commence par expliquer les bases de l’injection de prompts, illustrée par une bande dessinée XKCD. Il souligne la nature non déterministe des LLM, ce qui oblige à tester chaque attaque plusieurs fois. Il décrit ensuite l’architecture typique des systèmes d’IA d’entreprise, incluant des RAG, des agents et des applications web. Sa méthodologie en sept points comprend : identifier les entrées, attaquer l’écosystème, attaquer le modèle frontal, attaquer l’ingénierie des prompts, attaquer les données, attaquer l’application et pivoter pour montrer l’impact. Il illustre cette méthodologie avec des études de cas réelles : un chatbot d’Amazon (Rufus) contourné par un encodage ASCII, un système de santé où des fichiers malveillants ont permis d’exfiltrer des prompts et d’exécuter du JavaScript (blind XSS), et un système automobile interne. Il conclut en mentionnant des ressources pour apprendre, comme le CTF Gandalf et la taxonomie d’Arcanum.

165 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le conférencier partage des études de cas réelles et une méthodologie éprouvée, ce qui est rare dans le domaine. L’argumentation est solide, basée sur des exemples concrets et des retours d’expérience. Il explique clairement les concepts et les étapes, rendant la présentation accessible tout en restant technique.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : le conférencier s’appuie sur son expérience et des cas réels, mais ne cite pas de sources académiques. Les sources mentionnées sont principalement des références à des outils et des CTF (Gandalf, Bad Words). L’adéquation titre/contenu est parfaite : le titre ‘Attacking AI’ résume bien le sujet. Aucun commentaire n’a été fourni pour analyser les tendances du public.

132 mots

Adéquation titre / contenu

Le titre 'Attacking AI' reflète parfaitement le contenu : une présentation de méthodes et d'exemples d'attaques contre des systèmes basés sur l'IA.

Qualité & fiabilité

8/10

Conférence d'un expert reconnu en sécurité offensive, présentant une méthodologie basée sur des études de cas réelles. Les informations sont pratiques et issues d'expériences de terrain, mais reposent sur des preuves anecdotiques et ne sont pas soumises à une validation académique.

Moments clés

Sources citées

  • NDC Security — Conférence où le talk a été donné
  • NDC Conferences — Organisateur de la conférence

Sources concordantes

Apport & nouveautés

L’apport original de cette vidéo est la présentation d’une méthodologie pratique et éprouvée pour évaluer la sécurité des systèmes d’IA, basée sur des études de cas réelles. Contrairement aux approches académiques, elle se concentre sur des attaques réalistes et exploitables. Elle introduit également le concept de ‘first try fallacy’ et propose une taxonomie des injections de prompts.

Pour aller plus loin :

95 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité, mais un niveau technique légèrement inférieur, indiquant que le contenu est accessible tout en restant pertinent pour les experts.

Fiabilité 8/10