Aleksandra Bakalova: Discovering Interpretable Algorithms by Decompiling Transformers to RASP

Aleksandra Bakalova: Discovering Interpretable Algorithms by Decompiling Transformers to RASP

🎙 Aleksandra Bakalova et Shinting Huang 👥 3K 📅 2 juillet 2026 ⏱ 39 min 👁 135 📄 étude originale 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

interprétabilitétransformersRASPdécompilationcircuit discovery

Résumé

Cette présentation, donnée par Aleksandra Bakalova et Shinting Huang, expose une méthode pour extraire automatiquement des programmes RASP interprétables à partir de transformers entraînés. Les auteurs introduisent D-RASP, un dialecte de RASP adapté à la décompilation. La méthode procède en deux étapes : d’abord, une reparamétrisation fidèle du transformer en un programme D-RASP, en exploitant une hypothèse de linéarité des layer norms et une décomposition des MLP. Ensuite, une simplification par élagage (pruning) et remplacement de matrices par des primitives interprétables. Les résultats montrent que pour des tâches de généralisation de longueur, les programmes extraits sont courts et correspondent à des algorithmes humainement compréhensibles, comme le calcul du token le plus fréquent ou le tri. Cette approche constitue une avancée vers l’interprétation automatique des circuits internes des transformers, réduisant le besoin d’analyse manuelle. Les auteurs soulignent les limites, notamment la complexité exponentielle du programme initial et la dépendance à des hypothèses simplificatrices.

152 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : la méthode proposée est originale et répond à un problème central de l’interprétabilité mécanistique. L’argumentation est solide, s’appuyant sur une formalisation rigoureuse et des validations empiriques sur des tâches contrôlées. Les auteurs discutent des compromis entre fidélité et interprétabilité, ce qui renforce la crédibilité. Cependant, la généralisation à des modèles plus complexes reste à démontrer.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : la méthode est détaillée, les hypothèses sont explicitées, et les résultats sont présentés avec des exemples concrets. Les sources citées incluent des travaux fondateurs comme celui de Weiss et al. sur RASP, mais la présentation ne fournit pas de références bibliographiques complètes. L’adéquation titre/contenu est parfaite. Aucun commentaire n’étant fourni, aucune analyse des tendances du public n’est possible.

141 mots

Adéquation titre / contenu

Le titre reflète précisément le contenu : la présentation d'une méthode pour découvrir des algorithmes interprétables en décompilant des transformers vers RASP.

Qualité & fiabilité

8/10

Méthodologie rigoureuse, résultats reproductibles, mais dépendance à des hypothèses simplificatrices (linéarité des layer norms, splittabilité des MLP) et validation sur des tâches synthétiques.

Moments clés

Sources citées

  • Blog post associé au papier — Mentionné par les présentateurs comme ressource pour des visualisations intuitives.

Sources concordantes

Apport & nouveautés

L’apport principal est une méthode automatique pour extraire des programmes RASP interprétables à partir de transformers entraînés, sans intervention humaine. Cela comble une lacune des travaux précédents qui nécessitaient une analyse manuelle. La méthode est validée sur des tâches de généralisation de longueur, montrant que les modèles implémentent souvent des algorithmes simples et compréhensibles.

Pour aller plus loin :

102 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en niveau technique, indiquant un contenu dense et spécialisé. La fiabilité globale est bonne, mais légèrement inférieure, reflétant les hypothèses simplificatrices et le manque de validation sur des modèles plus grands.

Fiabilité 8/10