Sample Complexity and Mistake Bounds of Autoregressive Reasoning: CoT vs. EtE

Sample Complexity and Mistake Bounds of Autoregressive Reasoning: CoT vs. EtE

🎙 Idan Mehalel 👥 385 📅 14 mai 2026 ⏱ 61 min 👁 71 📄 exposé de recherche 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

apprentissage PACapprentissage en lignedimension VCdimension de Littlestonegénération autorégressive

Résumé

Cet exposé présente une analyse théorique de la complexité d’échantillonnage et des bornes d’erreur pour les modèles autorégressifs, en comparant deux types de supervision : la supervision de bout en bout (End-to-End) et la supervision par chaîne de pensée (Chain-of-Thought). Le cadre formel est celui de l’apprentissage PAC et de l’apprentissage en ligne, appliqué à des générateurs de jetons. L’orateur commence par motiver le modèle par les LLM et l’observation empirique que la chaîne de pensée améliore les performances. Il définit ensuite formellement le modèle autorégressif, où un générateur de jetons produit une séquence de bits, et où la sortie finale est le dernier bit. Il introduit les deux types de supervision et les deux cadres d’apprentissage. Les questions principales sont : comment la complexité d’échantillonnage et les bornes d’erreur évoluent avec la longueur de génération T, et dans quelle mesure la supervision par chaîne de pensée réduit cette dépendance. Les résultats présentés montrent que pour l’apprentissage de bout en bout, le paysage est très riche : on peut obtenir des taux d’apprentissage allant de constant à linéaire en T (dans le cas PAC) ou en T log T (dans le cas en ligne). En revanche, avec la supervision par chaîne de pensée, le taux d’apprentissage devient constant, indépendant de T, pour toute classe apprenable. Cela suggère que la chaîne de pensée élimine la dépendance en T, ce qui est un résultat optimiste pour l’apprentissage de tâches complexes. L’exposé se conclut par une discussion des preuves et des implications.

249 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’exposé présente des résultats théoriques originaux et précis, avec des définitions formelles et des preuves. L’argumentation est solide, structurée et progressive, allant de la motivation empirique aux résultats théoriques. L’orateur répond aux questions de l’auditoire de manière claire et précise, ce qui renforce la crédibilité. Les résultats sont présentés avec des nuances et des limites, ce qui montre une rigueur scientifique.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est excellente : les définitions sont précises, les résultats sont énoncés avec des conditions, et les preuves sont esquissées. Les sources sont mentionnées (Joshi et al., COLT 2025, et les travaux en cours avec Hanneke, Moran, Doron-Arad, Mossel), mais aucune référence complète n’est fournie dans la description. L’adéquation titre/contenu est parfaite : le titre décrit exactement le sujet de l’exposé. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

161 mots

Adéquation titre / contenu

Le titre reflète exactement le contenu : l'exposé porte sur la complexité d'échantillonnage et les bornes d'erreur pour le raisonnement autorégressif, comparant la supervision par chaîne de pensée et de bout en bout.

Qualité & fiabilité

8/10

Exposé théorique rigoureux, basé sur des travaux de recherche en cours, avec définitions formelles et preuves. Les résultats sont présentés de manière claire et les limites du modèle sont discutées. La qualité est élevée, mais le contenu n'est pas encore publié dans une revue à comité de lecture.

Moments clés

Sources citées

  • Joshi et al. (COLT 2025) - PAC-learning framework for next-token generators — Cadre d'apprentissage PAC pour les générateurs de jetons, mentionné comme base du modèle.
  • Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — Travail fondateur sur la chaîne de pensée, mentionné comme motivation empirique.

Sources concordantes

Apport & nouveautés

Cet exposé apporte une contribution théorique originale en caractérisant la complexité d’échantillonnage et les bornes d’erreur pour les modèles autorégressifs, avec une comparaison entre supervision de bout en bout et supervision par chaîne de pensée. Les résultats montrent que la chaîne de pensée peut éliminer la dépendance en T, ce qui est un résultat nouveau et important. L’exposé propose également une taxonomie des taux d’apprentissage possibles pour l’apprentissage de bout en bout.

Pour aller plus loin :

126 mots

Profil radar

Le profil radar montre une très haute qualité d'information et une rigueur scientifique élevée, avec un niveau technique soutenu. La quantité d'information est également bonne, mais la fiabilité globale est légèrement inférieure en raison du caractère non publié des travaux.

Fiabilité 8/10