Towards building safe and secure AI: Lessons and Open Challenges

Towards building safe and secure AI: Lessons and Open Challenges

🎙 Dawn Song 👥 5K 📅 11 août 2026 ⏱ 29 min 👁 8 📄 conférence 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

agentic AIsécuritéred teamingcybersécuritébenchmark

Résumé

Dawn Song, professeure à UC Berkeley, présente une conférence sur la construction d’une IA sûre et sécurisée, en se concentrant sur les agents IA (agentic AI). Elle distingue deux axes : sécuriser les systèmes d’agents contre les attaques, et atténuer les risques de mauvaise utilisation, notamment en cybersécurité. Pour le premier axe, elle décrit la diversité des agents et l’augmentation de la surface d’attaque, puis présente des travaux de red teaming automatique (LeakAgent, AgentAv2, AgentExploit) et des défenses comme ProAgent. Pour le second axe, elle présente des benchmarks (CyberGym, ExploitGym) mesurant les capacités des modèles frontières en cybersécurité, montrant que les attaquants bénéficient plus de l’IA que les défenseurs à court terme. Elle plaide pour une défense proactive par construction sécurisée et mentionne des initiatives comme AgentBeast et Agents Last Exam. Enfin, elle répond à une question sur l’interdiction des modèles frontières, soulignant la nécessité d’agir rapidement pour les défenseurs.

150 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence apporte une valeur significative en synthétisant des travaux de recherche récents et en proposant une taxonomie des risques et des défenses pour les agents IA. L’argumentation est structurée et s’appuie sur des exemples concrets (attaques réelles, benchmarks). La distinction entre sécurité au niveau du modèle et sécurité au niveau du système d’agents est claire et pertinente. L’accent mis sur la nécessité d’une approche sociotechnique et de politiques fondées sur des preuves est bien argumenté. Cependant, certaines parties sont survolées par manque de temps, et la démonstration de l’asymétrie attaquant-défenseur aurait pu être plus détaillée.

Rigueur scientifique, qualité des sources, adéquation du titre

La conférence est scientifiquement rigoureuse : l’oratrice est une experte reconnue, et les travaux cités sont issus de publications académiques et de benchmarks publics. Les sources sont de haute qualité, bien que non détaillées dans la vidéo (pas de références précises). Le titre est adéquat, reflétant bien le contenu. La description fournit des informations sur l’oratrice et le contexte, mais pas de liens directs vers les travaux mentionnés. Aucune séquence publicitaire n’est présente.

184 mots

Adéquation titre / contenu

Le titre est fidèle au contenu : la conférence aborde les défis de la sécurité et de la sûreté de l'IA, avec un accent sur les agents et la cybersécurité.

Qualité & fiabilité

8/10

Conférence par une experte reconnue (professeure à UC Berkeley, prix prestigieux), présentant des travaux de recherche publiés et des benchmarks publics. Les affirmations sont étayées par des références à des papiers et des systèmes concrets, mais la forme orale limite la profondeur des preuves.

Moments clés

Sources citées

  • International AI Report — Rapport mentionné par l'oratrice, dirigé par Yasha Banjo, couvrant les risques de l'IA.
  • AgentBeast — Plateforme pour l'évaluation standardisée des agents, mentionnée par l'oratrice.
  • Agents Last Exam — Benchmark pour évaluer les agents sur des tâches économiquement précieuses, mentionné par l'oratrice.
  • Agentic AI Learning — Cours en ligne sur l'IA agentique, mentionné par l'oratrice.

Sources concordantes

  • AgentBeast — Plateforme d'évaluation des agents, cohérente avec les propos de l'oratrice.
  • Agents Last Exam — Benchmark mentionné, cohérent avec les propos.

Apport & nouveautés

La conférence apporte une synthèse actualisée des risques et défenses pour les agents IA, en insistant sur la nécessité de considérer les adversaires. Elle présente des travaux originaux de red teaming automatique et des benchmarks pour mesurer les capacités des modèles en cybersécurité. L’idée d’une défense proactive par construction sécurisée est un apport conceptuel important.

Pour aller plus loin :

  • AgentBeast — Plateforme d’évaluation standardisée des agents, mentionnée dans la vidéo.
  • Agents Last Exam — Benchmark pour tâches économiquement précieuses, mentionné dans la vidéo.
  • OWASP Top 10 for LLM Applications — Référence sur les risques de sécurité des applications LLM, pertinente pour les agents.
  • AI Safety and Security — Article de synthèse sur la sécurité de l’IA, pertinent pour le contexte.

121 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité, mais un niveau technique modéré, ce qui reflète une conférence de synthèse destinée à un public large, avec des exemples concrets mais sans détails techniques approfondis.

Fiabilité 8/10