
Day 3: Shafi Goldwasser - Trustworthy AI: Robustness and Alignment | ADIA Lab Symposium 2025
Mots-clés
Résumé
173 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La conférence apporte une valeur scientifique élevée en présentant des résultats de recherche originaux et des preuves formelles. L’argumentation est solide, s’appuyant sur des concepts cryptographiques et des théorèmes. Goldwasser explique clairement les limites des approches naïves et justifie la nécessité d’une modélisation rigoureuse des adversaires. Elle illustre ses propos avec des exemples concrets (backdoors dans les systèmes d’admission, jailbreaks) et des analogies pédagogiques (calculatrice). La démonstration de l’impossibilité de filtrage externe est particulièrement convaincante et repose sur des hypothèses de temps de calcul.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est exemplaire : les résultats présentés sont issus de publications académiques et de travaux de recherche. Goldwasser cite ses propres travaux et ceux de ses collaborateurs, ainsi que des travaux d’autres chercheurs (par exemple, Boaz Barak). Les sources sont de haute qualité, mais la transcription ne fournit pas de références complètes. Le titre est en adéquation avec le contenu, qui traite spécifiquement de la robustesse et de l’alignement. Aucun commentaire n’a été fourni pour analyse.
177 mots
Adéquation titre / contenu
Le titre correspond parfaitement au contenu : il s'agit bien d'une conférence sur la fiabilité et l'alignement de l'IA, donnée par Shafi Goldwasser lors du symposium ADIA Lab 2025.
Qualité & fiabilité
8/10
Exposé par une experte de renommée mondiale (prix Turing), présentant des résultats de recherche théorique publiés et des preuves formelles. Le contenu est rigoureux, mais la transcription est partielle et le format oral limite la profondeur des détails techniques.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction par l'hôte et présentation de Shafi Goldwasser.
- Goldwasser pose les questions fondamentales sur la fiabilité de l'IA.
- Définition des défis de l'IA de confiance : confidentialité, vérification, robustesse, alignement.
- Introduction à la robustesse et aux attaques internes (backdoors).
- Présentation des travaux sur les backdoors indétectables dans les réseaux de neurones.
- Méthodes de défense par post-traitement et propriétés de self-reducibility.
- Discussion sur l'alignement et les jailbreaks.
- Impossibilité de filtrer efficacement les entrées/sorties nuisibles, preuve cryptographique.
- Conclusion et perspectives.
Sources citées
- Planting Undetectable Backdoors in Machine Learning Models — Article présenté par Goldwasser sur les backdoors indétectables.
- Oblivious Defense in Machine Learning Models — Article sur les méthodes de défense par post-traitement.
- Puzzle Jailbreaking LLMs through Word Based Puzzles — Article cité comme exemple de jailbreak.
Sources concordantes
- Adversarial Robustness - Theory and Practice — Travaux sur la robustesse adversarial, cohérents avec les propos de Goldwasser.
Sources discordantes
- Scaling Laws for Neural Language Models — Certains travaux empiriques suggèrent que les grands modèles de langage peuvent être fiables dans une certaine mesure, contrairement à l'accent mis par Goldwasser sur les limites théoriques.
Apport & nouveautés
La conférence apporte un éclairage théorique original sur la robustesse et l’alignement de l’IA, en utilisant des outils cryptographiques. Elle démontre que les backdoors peuvent être indétectables et propose des stratégies de défense par post-traitement. Elle établit également l’impossibilité de filtrage externe pour l’alignement, ce qui a des implications importantes pour la régulation.
Pour aller plus loin :
- Backdoor attacks on machine learning — Article de Wikipédia sur les attaques backdoor, pertinente pour comprendre le contexte.
- Adversarial machine learning — Article de Wikipédia sur l’apprentissage contradictoire, pertinent pour la robustesse.
- AI alignment — Article de Wikipédia sur l’alignement de l’IA, pertinent pour le sujet.
- Cryptography — Article de Wikipédia sur la cryptographie, pertinent pour la méthodologie employée.
117 mots
Profil radar
Le profil radar montre une excellente qualité et fiabilité de l'information, avec un niveau technique élevé. La quantité d'information est bonne, mais la durée limitée de la conférence ne permet pas d'approfondir tous les sujets. La fiabilité globale est renforcée par la réputation de l'intervenante et la rigueur des preuves présentées.