Adversarial Threats Across the ML Lifecycle: A Red Team Perspective

Adversarial Threats Across the ML Lifecycle: A Red Team Perspective

🎙 Sanket Badhe 👥 5K 📅 20 octobre 2025 ⏱ 35 min 👁 42 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

data poisoningevasion attackmodel extractionprompt injectionfeedback manipulation

Résumé

Dans cette conférence donnée lors du MLOps World | GenAI Summit 2025, Sanket Badhe, Senior Machine Learning Engineer chez TikTok, propose une analyse des menaces adversariales qui pèsent sur l’ensemble du cycle de vie d’un système de machine learning. Il adopte une perspective de red team, c’est-à-dire qu’il se met dans la peau d’un attaquant pour identifier les vulnérabilités. Il commence par définir un modèle de menace avec quatre grandes catégories d’attaques : l’évasion, l’empoisonnement, l’extraction et l’inférence. Ensuite, il détaille chaque phase du cycle de vie : la collecte et le labellisation des données (avec les attaques d’empoisonnement et les backdoors, illustrées par l’exemple des panneaux stop), le modèle lui-même (avec les attaques d’évasion comme l’exemple du panda de Goodfellow, et l’extraction de modèle), le déploiement (avec les injections de prompts, directes et indirectes), et enfin les boucles de rétroaction (avec le cas du bot Tay de Microsoft). Il propose des défenses pour chaque phase, comme la validation des données, l’entraînement adversarial, la séparation instruction/données, et la curation des feedbacks. Il insiste sur la nécessité d’une approche proactive et collaborative entre les équipes ML, sécurité et MLOps. Il mentionne des outils comme ART d’IBM, TextAttack et le framework ATLAS de MITRE. La conclusion souligne que la sécurité ML est un sport d’équipe et doit être intégrée dès la conception.

220 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence offre une vue d’ensemble claire et structurée des menaces adversariales sur le cycle de vie ML. L’argumentation est solide, appuyée par des exemples concrets et des références à des travaux de recherche reconnus (BadNets, attaques de Goodfellow, cas Tay). L’orateur adopte une approche pédagogique, expliquant les concepts de manière accessible sans sacrifier la précision technique. La valeur ajoutée réside dans la mise en perspective des différentes attaques et de leurs défenses, ainsi que dans l’accent mis sur la nécessité d’une approche holistique et collaborative. Cependant, certains points auraient pu être approfondis, comme les aspects juridiques ou les limites des défenses proposées.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est globalement bonne : l’orateur cite des travaux académiques et des cas réels, mais sans fournir de références précises (auteurs, années, publications). Les sources mentionnées sont fiables (BadNets, Goodfellow, Microsoft Tay), mais leur présentation reste superficielle. Le titre est en adéquation parfaite avec le contenu. La conférence est une revue d’actualité et de bonnes pratiques, plus qu’une présentation de recherche originale. L’absence de sources détaillées dans la description (seul le site de la conférence est fourni) limite la vérifiabilité.

200 mots

Adéquation titre / contenu

Le titre est parfaitement représentatif du contenu : la conférence couvre bien les menaces adversariales sur l'ensemble du cycle de vie du ML, avec une perspective de red team.

Qualité & fiabilité

7/10

La présentation s'appuie sur des exemples concrets et des références académiques reconnues (BadNets, attaques adversariales de Goodfellow, cas Tay de Microsoft). L'approche est structurée et pragmatique, mais certaines affirmations manquent de nuances et les sources ne sont pas systématiquement citées avec précision.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

La conférence apporte une synthèse actualisée des menaces adversariales sur l’ensemble du cycle de vie ML, avec une perspective de red team. Elle met en lumière des points souvent négligés comme la manipulation des boucles de rétroaction et l’importance de la collaboration entre équipes. L’originalité réside dans la structuration claire des attaques et des défenses, et dans l’accent mis sur la nécessité d’une approche proactive et continue.

Pour aller plus loin :

143 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et une fiabilité correcte, mais un niveau technique modéré. La conférence est accessible à un public large tout en restant précise, ce qui explique ces scores. La qualité de l'information est bonne, mais sans approfondissement extrême.

Fiabilité 7/10