
Dana Arad: SAEs for Content Control
Mots-clés
Résumé
158 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : la présentatrice expose des résultats de recherche originaux, avec une méthodologie claire et des exemples concrets. L’argumentation est solide, appuyée sur des expériences et des comparaisons avec des méthodes de référence. Elle répond aux questions avec précision et nuance, reconnaissant les limites de son approche. La distinction entre caractéristiques d’entrée et de sortie est bien motivée et illustrée, et la méthode d’unlearning est présentée comme une avancée prometteuse.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : les travaux sont présentés avec des détails méthodologiques, et les références à des travaux antérieurs (Anthropic, Stanford, etc.) sont mentionnées. La qualité des sources est correcte, bien que la présentation ne cite pas explicitement toutes les publications. L’adéquation titre/contenu est parfaite : le titre reflète exactement le sujet de l’exposé.
146 mots
Adéquation titre / contenu
Le titre est précis et correspond exactement au contenu : présentation de deux travaux sur l'utilisation des SAE pour le contrôle de contenu.
Qualité & fiabilité
8/10
Exposé scientifique de haut niveau par une chercheuse spécialiste, s'appuyant sur des travaux publiés et des résultats expérimentaux. Les méthodes sont décrites avec précision, les limites sont évoquées, et les références sont clairement identifiées. La présentation est rigoureuse, avec une distinction nette entre observations et interprétations.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et contexte de la présentation
- Définition de la polysémanticité et introduction aux SAE
- Explication du fonctionnement des SAE et de leur entraînement
- Présentation du concept de steering et de ses applications
- Discussion sur les limites des SAE pour le steering et comparaison avec des méthodes simples
- Introduction de la taxonomie input/output features
- Définition des scores d'entrée et de sortie et exemples
- Analyse de l'émergence des features selon les couches du modèle
- Présentation de la méthode d'unlearning persistant avec les SAE
- Discussion et questions-réponses
Sources citées
- Steering LLMs: Even Simple Baselines Outperform Sparse Autoencoders — Comparaison des méthodes de steering, mentionnée comme source de motivation
- Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet — Travail d'Anthropic sur les SAE et le steering, cité pour l'exemple de biais de genre
- Gemma Scope — SAE pré-entraînés sur Gemma, utilisés pour les exemples de steering
Sources concordantes
- Scaling Monosemanticity — Confirme l'utilité des SAE pour le steering dans certains cas
- Steering LLMs: Even Simple Baselines Outperform Sparse Autoencoders — Montre les limites des SAE pour le steering, ce qui motive la taxonomie proposée
Sources discordantes
- Steering LLMs: Even Simple Baselines Outperform Sparse Autoencoders — Ce travail suggère que les SAE ne sont pas efficaces pour le steering, contrairement à ce que la présentatrice défend, mais elle explique que cela est dû à une sélection inadéquate des caractéristiques.
Apport & nouveautés
L’apport principal est la distinction entre caractéristiques d’entrée et de sortie dans les SAE, avec des métriques pour les quantifier, et la démonstration que cette distinction est cruciale pour le steering. La méthode d’unlearning persistant utilisant les caractéristiques SAE est également une contribution originale. Ces travaux ouvrent la voie à un contrôle plus fin et interprétable des modèles de langage.
Pour aller plus loin :
- Sparse Autoencoders — Article fondateur d’Anthropic sur les SAE.
- Logit Lens — Méthode d’interprétation utilisée dans l’exposé.
- Mechanistic Interpretability — Ressource sur l’interprétabilité mécaniste.
89 mots
Profil radar
Le profil radar montre une excellente qualité d'information et une bonne fiabilité, avec un niveau technique élevé. La quantité d'information est également bonne, mais la note globale est légèrement inférieure en raison de la spécialisation du sujet.