Josh Batson - Interpretability: From Art Towards Science - IPAM at UCLA

Josh Batson - Interpretability: From Art Towards Science - IPAM at UCLA

🎙 Josh Batson (Anthropic) 👥 42K 📅 1 septembre 2026 ⏱ 43 min 👁 6 📄 conférence scientifique 🧭 2026-09-01
Disponible en : Français (actuel) English

Mots-clés

interprétabilitémécanismes internesapprentissage de représentationscircuitsanalyse mécaniste

Résumé

Josh Batson, chercheur chez Anthropic, présente une conférence sur l’interprétabilité des modèles de langage, proposant une vision où l’analyse mécaniste évolue vers une science plus formelle. Il introduit quatre métaphores pour comprendre les modèles : la physique (dynamique d’entraînement), les motifs (représentations et caractéristiques), les programmes (circuits et algorithmes appris) et les personnes (attribution d’états mentaux). Il illustre ces métaphores avec des exemples concrets : l’apprentissage de l’arithmétique modulaire, la découverte de caractéristiques comme le vecteur ‘Golden Gate Bridge’, et l’analyse de circuits pour l’addition. Il souligne que les modèles apprennent des régularités du monde, parfois plus subtiles que celles perçues par les humains, et que l’interprétabilité permet de les identifier et de les manipuler. Il conclut en évoquant des problèmes ouverts et la nécessité de développer une théorie plus solide pour expliquer l’émergence de ces structures.

137 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : la conférence présente des résultats de recherche originaux et des observations détaillées sur les mécanismes internes des modèles de langage. L’argumentation est solide, s’appuyant sur des exemples concrets et des visualisations, et elle est structurée autour de métaphores heuristiques. L’orateur adopte un ton pédagogique et honnête, reconnaissant les limites de la compréhension actuelle et proposant des pistes pour une approche plus scientifique. La démonstration de l’apprentissage de l’arithmétique modulaire et l’analyse des circuits d’addition sont particulièrement convaincantes et illustrent bien la progression de l’artisanat vers la science.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des travaux de recherche (par exemple, sur les représentations linéaires du sentiment, les autoencodeurs parcimonieux) et présente des résultats reproductibles. La qualité des sources est correcte, bien que la description ne fournisse qu’un lien vers l’atelier IPAM. L’adéquation entre le titre et le contenu est bonne : le titre annonce une réflexion sur la scientificité de l’interprétabilité, et la conférence tient cette promesse en explorant les méthodes et les limites. Aucun commentaire n’est fourni pour analyser les tendances du public.

197 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : la conférence explore la transition de l'interprétabilité comme pratique artisanale vers une science plus formelle, avec des métaphores et des exemples.

Qualité & fiabilité

8/10

Conférence scientifique par un chercheur d'Anthropic, présentant des résultats de recherche et des phénomènes observés. Le contenu est technique, s'appuie sur des exemples concrets et des travaux publiés, mais reste une présentation orale sans publication associée dans la description.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

La conférence apporte une perspective originale sur l’interprétabilité en proposant un cadre métaphorique (physique, motifs, programmes, personnes) et en illustrant la transition d’une analyse artisanale vers une science plus formelle. Elle présente des résultats concrets sur l’apprentissage de l’arithmétique modulaire et l’analyse de circuits, et souligne l’importance de l’observation et de l’intervention pour comprendre les modèles. L’accent mis sur les problèmes ouverts et la nécessité d’une théorie de l’émergence est une contribution stimulante.

Pour aller plus loin :

  • Sparse autoencoders — Article de recherche d’Anthropic sur l’utilisation d’autoencodeurs parcimonieux pour identifier des caractéristiques interprétables.
  • Linear representations of sentiment — Article de recherche sur les représentations linéaires du sentiment dans les modèles de langage.
  • Mechanistic interpretability — Page LessWrong présentant des ressources et discussions sur l’interprétabilité mécaniste.

126 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés en quantité d'information, qualité, niveau technique et fiabilité, reflétant une conférence dense et rigoureuse. Le niveau technique élevé indique un contenu destiné à un public averti, mais la clarté de l'exposé le rend accessible.

Fiabilité 8/10