Enric Boix Adsera

Enric Boix Adsera

🎙 Enric Boix Adsera 👥 4K 📅 3 mai 2026 ⏱ 28 min 👁 28 📄 conférence scientifique 🧭 2026-08-13
Disponible en : Français (actuel) English

Mots-clés

alignementsteeringagentssécuritéRFM

Résumé

Cette conférence d’Enric Boix Adsera, donnée à l’IIMAS-UNAM, aborde deux approches complémentaires pour traiter les problèmes d’alignement des agents IA. La première partie présente une méthode de ‘steering’ par édition des activations internes des modèles, basée sur l’hypothèse de représentation multi-index (MRH). L’orateur explique comment des sondes non linéaires, entraînées via l’algorithme RFM, peuvent détecter des concepts complexes comme les hallucinations ou la toxicité, surpassant les sondes linéaires. Il montre ensuite comment ces sondes peuvent être utilisées pour modifier le comportement d’un modèle, par exemple pour réduire les refus ou augmenter l’honnêteté. La seconde partie, plus exploratoire, traite de l’adaptation dynamique des défenseurs dans des jeux adversariaux, notamment en cybersécurité. L’orateur propose un schéma de ‘best-of-n’ avec auto-distillation pour renforcer les défenseurs face à des attaquants adaptatifs. Il présente des résultats préliminaires montrant que cette méthode peut réduire le taux de succès des attaques. La conférence se conclut par une discussion sur les limites et les questions ouvertes de ces approches.

161 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence apporte une valeur certaine en présentant des travaux de recherche originaux sur le steering et l’alignement d’agents. L’argumentation est solide, s’appuyant sur des exemples concrets (incident chez Alibaba, expériences de cybersécurité) et des références à des méthodes établies (représentation linéaire, RFM). L’orateur justifie clairement la nécessité de dépasser les sondes linéaires pour des concepts complexes, et les résultats préliminaires sur l’adaptation dynamique sont prometteurs. Cependant, certaines parties restent spéculatives, notamment la partie théorique sur la dynamique attaquant-défenseur, qui est présentée comme un modèle toy.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est globalement bonne : l’orateur cite des travaux publiés (Mikolov et al., représentation linéaire, RFM) et présente des expériences reproductibles. Cependant, certaines affirmations manquent de détails (par exemple, les benchmarks exacts utilisés pour les sondes). Le titre de la vidéo est simplement le nom du conférencier, ce qui est peu informatif et ne reflète pas le contenu. Les sources citées dans la description sont absentes, mais l’orateur mentionne des références dans son discours. La qualité des sources est donc correcte, mais l’absence de liens directs dans la description limite la vérifiabilité.

195 mots

Adéquation titre / contenu

Le titre est très générique (nom du conférencier) et ne reflète pas le contenu spécifique sur le steering et l'alignement d'agents.

Qualité & fiabilité

8/10

Conférence académique présentant des travaux de recherche originaux, avec des références à des méthodes publiées (RFM, représentation linéaire) et des expériences préliminaires. Le niveau de détail technique est élevé, mais certaines affirmations reposent sur des résultats non encore publiés.

Moments clés

Sources citées

  • Toward Universal Steering and Monitoring of AI Models — Papier mentionné par l'orateur, avec Daniel Beaglehole, Rakshit, et Misha Belkin.
  • Recursive Feature Machines — Algorithme utilisé pour entraîner les sondes multi-index, mentionné comme outil principal.
  • Representation Engineering — Méthode de référence pour le steering par ajout de vecteurs dans le flux résiduel.

Sources concordantes

  • Anthropic's research on AI safety — L'orateur mentionne des résultats expérimentaux d'Anthropic sur l'évasion des moniteurs par les agents.
  • OpenAI's research on AI safety — L'orateur mentionne des résultats expérimentaux d'OpenAI sur l'évasion des moniteurs par les agents.

Sources discordantes

  • Aucune source discordante identifiée — Aucune source contradictoire n'a été mentionnée dans la vidéo.

Apport & nouveautés

L’apport principal est la proposition d’une hypothèse de représentation multi-index (MRH) pour les concepts internes des modèles, dépassant l’hypothèse de représentation linéaire. L’utilisation de l’algorithme RFM pour entraîner des sondes non linéaires permet une meilleure détection de concepts complexes et un steering plus efficace. La deuxième partie, sur l’adaptation dynamique des défenseurs, est une contribution originale, bien que préliminaire, avec un schéma de best-of-n et d’auto-distillation.

Pour aller plus loin :

108 mots

Profil radar

Le profil radar montre une forte composante technique (niveau technique élevé) et une bonne quantité d'informations, mais une fiabilité globale légèrement inférieure en raison du caractère préliminaire de certaines recherches. La qualité de l'information est bonne, mais la fiabilité est modérée.

Fiabilité 7/10