Day 3: Shafi Goldwasser - Trustworthy AI: Robustness and Alignment | ADIA Lab Symposium 2025

Day 3: Shafi Goldwasser - Trustworthy AI: Robustness and Alignment | ADIA Lab Symposium 2025

🎙 Shafi Goldwasser 👥 824 📅 5 novembre 2025 ⏱ 29 min 👁 110 📄 conférence scientifique 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

robustessealignementbackdoorscryptographieIA fiable

Résumé

Shafi Goldwasser, professeure au MIT et lauréate du prix Turing, présente une conférence sur la fiabilité et l’alignement des modèles d’apprentissage automatique. Elle commence par souligner les défis de l’IA : hallucinations, manque de compréhension, absence de surveillance, et intérêts non altruistes. Elle insiste sur l’urgence de développer des méthodes pour garantir la fiabilité de l’IA, déjà largement déployée dans des domaines critiques. Elle définit ensuite les principaux défis de l’IA de confiance : confidentialité, vérification, robustesse et alignement. Elle se concentre sur la robustesse face aux attaques internes (backdoors) et sur l’alignement. Pour la robustesse, elle présente des travaux sur les backdoors indétectables dans les réseaux de neurones, montrant qu’il est possible d’en insérer sans être détecté, et propose des méthodes de défense par post-traitement, inspirées de la cryptographie. Pour l’alignement, elle discute des jailbreaks et montre, à l’aide d’arguments cryptographiques, qu’il est impossible de filtrer efficacement les entrées ou sorties nuisibles sans avoir accès au modèle interne. Elle conclut sur la nécessité de recherches théoriques pour garantir la fiabilité de l’IA.

173 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence apporte une valeur scientifique élevée en présentant des résultats de recherche originaux et des preuves formelles. L’argumentation est solide, s’appuyant sur des concepts cryptographiques et des théorèmes. Goldwasser explique clairement les limites des approches naïves et justifie la nécessité d’une modélisation rigoureuse des adversaires. Elle illustre ses propos avec des exemples concrets (backdoors dans les systèmes d’admission, jailbreaks) et des analogies pédagogiques (calculatrice). La démonstration de l’impossibilité de filtrage externe est particulièrement convaincante et repose sur des hypothèses de temps de calcul.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est exemplaire : les résultats présentés sont issus de publications académiques et de travaux de recherche. Goldwasser cite ses propres travaux et ceux de ses collaborateurs, ainsi que des travaux d’autres chercheurs (par exemple, Boaz Barak). Les sources sont de haute qualité, mais la transcription ne fournit pas de références complètes. Le titre est en adéquation avec le contenu, qui traite spécifiquement de la robustesse et de l’alignement. Aucun commentaire n’a été fourni pour analyse.

177 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : il s'agit bien d'une conférence sur la fiabilité et l'alignement de l'IA, donnée par Shafi Goldwasser lors du symposium ADIA Lab 2025.

Qualité & fiabilité

8/10

Exposé par une experte de renommée mondiale (prix Turing), présentant des résultats de recherche théorique publiés et des preuves formelles. Le contenu est rigoureux, mais la transcription est partielle et le format oral limite la profondeur des détails techniques.

Moments clés

Sources citées

  • Planting Undetectable Backdoors in Machine Learning Models — Article présenté par Goldwasser sur les backdoors indétectables.
  • Oblivious Defense in Machine Learning Models — Article sur les méthodes de défense par post-traitement.
  • Puzzle Jailbreaking LLMs through Word Based Puzzles — Article cité comme exemple de jailbreak.

Sources concordantes

  • Adversarial Robustness - Theory and Practice — Travaux sur la robustesse adversarial, cohérents avec les propos de Goldwasser.

Sources discordantes

  • Scaling Laws for Neural Language Models — Certains travaux empiriques suggèrent que les grands modèles de langage peuvent être fiables dans une certaine mesure, contrairement à l'accent mis par Goldwasser sur les limites théoriques.

Apport & nouveautés

La conférence apporte un éclairage théorique original sur la robustesse et l’alignement de l’IA, en utilisant des outils cryptographiques. Elle démontre que les backdoors peuvent être indétectables et propose des stratégies de défense par post-traitement. Elle établit également l’impossibilité de filtrage externe pour l’alignement, ce qui a des implications importantes pour la régulation.

Pour aller plus loin :

  • Backdoor attacks on machine learning — Article de Wikipédia sur les attaques backdoor, pertinente pour comprendre le contexte.
  • Adversarial machine learning — Article de Wikipédia sur l’apprentissage contradictoire, pertinent pour la robustesse.
  • AI alignment — Article de Wikipédia sur l’alignement de l’IA, pertinent pour le sujet.
  • Cryptography — Article de Wikipédia sur la cryptographie, pertinent pour la méthodologie employée.

117 mots

Profil radar

Le profil radar montre une excellente qualité et fiabilité de l'information, avec un niveau technique élevé. La quantité d'information est bonne, mais la durée limitée de la conférence ne permet pas d'approfondir tous les sujets. La fiabilité globale est renforcée par la réputation de l'intervenante et la rigueur des preuves présentées.

Fiabilité 8/10