Hacking AI Systems: How to (Still) Trick Artificial Intelligence • GOTO 2025

Hacking AI Systems: How to (Still) Trick Artificial Intelligence • GOTO 2025

🎙 Katharine Jarmul 👥 1.1M 📅 8 janvier 2026 ⏱ 35 min 👁 2K 📄 conférence technique 🧭 2026-08-02
Disponible en : Français (actuel) English

Mots-clés

adversarial AIdeep learningembeddingsdonnées d'entraînementsécurité

Résumé

Dans cette conférence enregistrée au GOTO Copenhagen 2025, Katharine Jarmul, experte en confidentialité des données, explore les vulnérabilités des systèmes d’intelligence artificielle et les méthodes pour les exploiter. Elle commence par adopter la perspective d’un attaquant, détaillant les objectifs typiques : perturbation, exploitation, extraction de données, ou atteinte à la réputation. Elle présente ensuite les architectures courantes des systèmes d’IA, des grands modèles hébergés dans le cloud aux agents locaux, et identifie les points d’entrée potentiels. La conférence se concentre sur les faiblesses inhérentes aux modèles, notamment les données d’entraînement qui contiennent souvent des informations sensibles ou biaisées, et les espaces d’embedding qui peuvent être manipulés. Jarmul explique comment les attaquants peuvent exploiter ces faiblesses pour faire dévier les modèles, en s’appuyant sur des exemples concrets et des démonstrations. Elle aborde également les mesures de protection, telles que le filtrage des données, la surveillance des entrées, et l’utilisation de techniques de robustesse. La présentation se termine par des recommandations pratiques pour renforcer la sécurité des systèmes d’IA et par des ressources pour approfondir le sujet.

175 mots

Évaluation critique

La conférence de Katharine Jarmul offre une introduction solide et accessible aux attaques adversariales sur les systèmes d’IA. L’approche pédagogique, qui consiste à se mettre dans la peau d’un attaquant, est efficace pour comprendre les motivations et les méthodes. L’utilisation d’exemples concrets, comme les images scrapées dans les jeux de données, rend le sujet tangible. La présentation est bien structurée, avec des sections claires sur les faiblesses potentielles et les stratégies d’exploitation. Cependant, on peut regretter que certaines affirmations ne soient pas étayées par des références précises, bien que l’oratrice mentionne des travaux de recherche et des ressources. La partie sur les embeddings et la théorie du codage est intéressante mais reste superficielle ; elle aurait pu être approfondie pour un public plus technique. La conférence couvre un large éventail de sujets, mais certains aspects, comme les attaques par empoisonnement de données, ne sont qu’effleurés. La qualité des sources est bonne, avec des références à des travaux académiques et des ressources en ligne. L’adéquation entre le titre et le contenu est parfaite. Dans l’ensemble, cette conférence est une excellente introduction à la sécurité des systèmes d’IA, mais elle manque de profondeur pour les experts du domaine.

196 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : la conférence traite des méthodes pour tromper les systèmes d'IA, avec des exemples et des stratégies de protection.

Qualité & fiabilité

8/10

Exposé par une experte reconnue en confidentialité des données, s'appuyant sur des exemples concrets et des références à des travaux de recherche. La présentation est structurée et pédagogique, mais certaines affirmations générales manquent de citations précises.

Chapitres

Sources citées

Sources concordantes

Sources discordantes

Références externes

Apport & nouveautés

Cette conférence apporte une perspective pratique sur la sécurité des systèmes d’IA, en insistant sur la nécessité de penser comme un attaquant. Elle met en lumière des vulnérabilités souvent négligées, comme les données d’entraînement contaminées et les espaces d’embedding manipulables. L’originalité réside dans la démonstration que les attaques adversariales sont toujours possibles malgré les avancées en matière de robustesse.

Pour aller plus loin :

  • Adversarial machine learning — Article de Wikipédia couvrant les principes et les attaques adversariales.
  • Word2vec — Article sur la technique d’embedding qui a révolutionné le traitement du langage naturel.
  • Data poisoning — Article sur l’empoisonnement des données d’entraînement, une attaque mentionnée dans la conférence.

108 mots

Profil radar

Le profil radar montre une conférence équilibrée, avec des scores élevés en quantité et qualité d'information, ainsi qu'une bonne fiabilité. Le niveau technique est légèrement inférieur, indiquant une accessibilité pour un public large, mais avec des concepts avancés.

Fiabilité 8/10