
Aleksandra Bakalova: Discovering Interpretable Algorithms by Decompiling Transformers to RASP
Mots-clés
Résumé
152 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : la méthode proposée est originale et répond à un problème central de l’interprétabilité mécanistique. L’argumentation est solide, s’appuyant sur une formalisation rigoureuse et des validations empiriques sur des tâches contrôlées. Les auteurs discutent des compromis entre fidélité et interprétabilité, ce qui renforce la crédibilité. Cependant, la généralisation à des modèles plus complexes reste à démontrer.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : la méthode est détaillée, les hypothèses sont explicitées, et les résultats sont présentés avec des exemples concrets. Les sources citées incluent des travaux fondateurs comme celui de Weiss et al. sur RASP, mais la présentation ne fournit pas de références bibliographiques complètes. L’adéquation titre/contenu est parfaite. Aucun commentaire n’étant fourni, aucune analyse des tendances du public n’est possible.
141 mots
Adéquation titre / contenu
Le titre reflète précisément le contenu : la présentation d'une méthode pour découvrir des algorithmes interprétables en décompilant des transformers vers RASP.
Qualité & fiabilité
8/10
Méthodologie rigoureuse, résultats reproductibles, mais dépendance à des hypothèses simplificatrices (linéarité des layer norms, splittabilité des MLP) et validation sur des tâches synthétiques.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et contexte : question des algorithmes internes des transformers, lien avec RASP.
- Présentation des contributions : méthode de décompilation automatique vers D-RASP.
- Définition de D-RASP et de ses opérations (select, aggregate, element-wise, project).
- Reparamétrisation : réécriture fidèle d'un transformer en programme D-RASP, couche par couche.
- Hypothèses simplificatrices : linéarité des layer norms et splittabilité des MLP.
- Simplification du programme : élagage et remplacement de matrices par des primitives interprétables.
- Exemple 1 : extraction d'un programme pour la tâche du token le plus fréquent.
- Exemple 2 : extraction d'un programme pour la tâche de tri.
- Discussion et conclusion : limites et perspectives.
Sources citées
- Blog post associé au papier — Mentionné par les présentateurs comme ressource pour des visualisations intuitives.
Sources concordantes
- RASP: A Language for Neural Network Computation — Travail fondateur sur RASP, cité comme base de la méthode.
Apport & nouveautés
L’apport principal est une méthode automatique pour extraire des programmes RASP interprétables à partir de transformers entraînés, sans intervention humaine. Cela comble une lacune des travaux précédents qui nécessitaient une analyse manuelle. La méthode est validée sur des tâches de généralisation de longueur, montrant que les modèles implémentent souvent des algorithmes simples et compréhensibles.
Pour aller plus loin :
- RASP: A Language for Neural Network Computation — Article fondateur de Weiss et al. définissant RASP.
- A Mathematical Framework for Transformer Circuits — Cadre pour l’analyse mécanistique des transformers.
- Towards Automated Circuit Discovery for Mechanistic Interpretability — Méthodes automatiques de découverte de circuits.
102 mots
Profil radar
Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en niveau technique, indiquant un contenu dense et spécialisé. La fiabilité globale est bonne, mais légèrement inférieure, reflétant les hypothèses simplificatrices et le manque de validation sur des modèles plus grands.