Ryan Cotterell - Two views of a language model - IPAM at UCLA

Ryan Cotterell - Two views of a language model - IPAM at UCLA

Ryan Cotterell - Deux vues d'un modèle de langage - IPAM à UCLA

🎙 Ryan Cotterell 👥 42K 📅 1 septembre 2026 ⏱ 45 min 👁 22 📄 exposé scientifique 🧭 2026-09-01
Disponible en : Français (actuel) English

Mots-clés

modèle de languetransformersexpressivitésuccinctnesslangages star-free

Résumé

Ryan Cotterell, professeur à l’ETH Zurich, présente une analyse théorique des modèles de langue sous deux angles : statistique et computationnel. Il commence par définir formellement un modèle de langue comme une distribution de probabilité sur les chaînes, puis introduit la factorisation autorégressive. Il souligne que la vue statistique, centrée sur la prédiction moyenne, ne garantit pas l’existence d’un algorithme correct sur toutes les entrées. Il propose donc une vue computationnelle, où le modèle est considéré comme un reconnaisseur de langage. Il introduit les idéalisations de transformateur à précision bornée et à attention dure (UHAT). Il présente des résultats d’expressivité : les UHAT reconnaissent exactement les langages star-free, une classe subrégulière, ce qui les place en dessous des RNN. Il introduit ensuite la notion de succinctness, montrant que les UHAT peuvent être exponentiellement plus succincts que les LTL et les RNN, et doublement exponentiellement plus succincts que les automates finis. Enfin, il montre que les problèmes de vérification de base (vacuité, équivalence) pour les transformateurs sont EXPSPACE-complets, ce qui rend tout raisonnement général sur leur comportement impossible en pratique.

179 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’exposé fournit une synthèse claire et rigoureuse de résultats théoriques récents sur les transformateurs, avec des définitions précises et des démonstrations esquissées. L’argumentation est solide, structurée autour d’une opposition entre deux paradigmes (statistique vs computationnel) et d’une progression logique vers des résultats de complexité. L’orateur justifie ses choix d’idéalisation (précision bornée, attention dure) et discute de leurs implications. Il prend soin de distinguer les résultats établis des conjectures et des questions ouvertes.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est exemplaire : les définitions sont formelles, les résultats sont énoncés avec leurs conditions, et les preuves sont esquissées. Les sources sont implicites mais correspondent à des travaux publiés dans des conférences de premier plan (ICML, NeurIPS, ACL). Le titre est parfaitement adéquat au contenu. La description fournit un lien vers l’atelier IPAM, qui peut servir de référence pour les travaux présentés.

159 mots

Adéquation titre / contenu

Le titre reflète exactement le contenu : l'exposé développe deux perspectives complémentaires sur les modèles de langue, statistique et computationnelle.

Qualité & fiabilité

8/10

Exposé théorique rigoureux, s'appuyant sur des définitions formelles et des résultats publiés dans des conférences majeures (ICML, NeurIPS). Le locuteur est un chercheur reconnu (ETH Zurich). Les résultats sont présentés avec des preuves et des références implicites à la littérature.

Moments clés

Sources citées

Sources concordantes

  • Attention is Turing Complete (Pérez et al., 2019) — Cité comme exemple de résultat de complétude de Turing pour les transformateurs, mais critiqué pour son manque de réalisme.
  • On the Computational Power of RNNs (Siegelmann & Sontag, 1995) — Cité comme exemple de résultat de complétude de Turing pour les RNN, avec la même critique.

Sources discordantes

  • Attention is Turing Complete (Pérez et al., 2019) — Ce résultat, qui montre que les transformateurs avec précision arbitraire peuvent simuler une machine de Turing, est en tension avec les résultats présentés ici qui utilisent une précision bornée et montrent une expressivité limitée.

Apport & nouveautés

L’apport original de cet exposé est de clarifier la distinction entre les vues statistique et computationnelle des modèles de langue, et de montrer que la notion de succinctness est plus pertinente que l’expressivité brute pour comparer les transformateurs à d’autres formalismes. Il présente des résultats récents (probablement issus de ses travaux) sur la double exponentielle de succinctness par rapport aux automates finis, et sur la complexité EXPSPACE des problèmes de vérification.

Pour aller plus loin :

115 mots

Profil radar

Le profil radar montre un niveau technique très élevé, une qualité d'information excellente, mais une quantité d'information modérée (la vidéo est dense et ciblée). La fiabilité globale est bonne, soutenue par la rigueur des définitions et des preuves.

Fiabilité 8/10