
Séminaire DIC-ISC-CRIA - 20 novembre 2025 par Ari HOLTZMAN
Mots-clés
Résumé
144 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : l’orateur propose un cadre conceptuel original pour étudier les LLM, en les considérant comme des systèmes complexes plutôt que comme des artefacts d’ingénierie. Il argumente de manière convaincante que les approches mécanistes actuelles sont limitées et que des descriptions comportementales précises sont nécessaires. L’argumentation est structurée et s’appuie sur des exemples concrets, comme l’analogie avec la taxonomie de Linné et la théorie de l’évolution. L’orateur reconnaît les limites de ses propres travaux et les questions ouvertes, ce qui renforce la crédibilité de son propos.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : l’orateur cite ses propres travaux et ceux d’autres chercheurs, et présente des données expérimentales. Les sources sont de qualité (publications ICLR, EMNLP, arXiv). L’adéquation entre le titre et le contenu est bonne, même si le titre est métaphorique. Le contenu est cohérent avec le titre, qui évoque l’articulation de l’ineffable, c’est-à-dire la mise en mots de comportements difficiles à décrire.
172 mots
Adéquation titre / contenu
Le titre est ambitieux et métaphorique, mais le contenu correspond bien à une tentative d'articuler des comportements ineffables des LLM.
Qualité & fiabilité
8/10
Exposé scientifique rigoureux, s'appuyant sur des travaux publiés et des expériences contrôlées. Les limites des résultats sont clairement énoncées. Quelques affirmations théoriques (ex. nécessité de mémorisation) sont présentées sans démonstration complète.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et remerciements
- Définition de l'ineffable et objectif de la présentation
- Les LLM comme organisme modèle pour l'articulation
- Comparaison avec les humains : mesurabilité et répétabilité
- Limites des approches mécanistes et nécessité d'une approche comportementale
- Présentation du benchmark AbsenceBench
- Résultats : les LLM échouent à détecter les omissions
- Hypothèses sur les causes : attention et pivot
- Discussion et questions
Sources citées
- Generative Models as a Complex Systems Science — Référence principale de l'orateur sur la vision des LLM comme systèmes complexes
- The Curious Case of Neural Text Degeneration — Article fondateur sur le nucleus sampling, introduit par Holtzman
- Symbolic Knowledge Distillation: from General Language Models to Commonsense Models — Travail sur la distillation de connaissances symboliques
- Surface Form Competition: Why the Highest Probability Answer Isn't Always Right — Étude sur la compétition des formes de surface
Sources concordantes
- Generative Models as a Complex Systems Science — L'orateur s'appuie sur ce papier pour justifier son approche.
Apport & nouveautés
L’apport original de cette présentation est de proposer un changement de paradigme dans l’étude des LLM : passer d’une approche mécaniste à une approche comportementale et prédictive, inspirée des sciences naturelles. L’orateur introduit le concept de ‘science des LLM’ et insiste sur la nécessité de développer un vocabulaire précis pour décrire les comportements. Il présente également un nouveau benchmark, AbsenceBench, qui révèle une limitation surprenante des LLM : leur incapacité à détecter des omissions. Cette découverte ouvre des pistes de recherche importantes.
Pour aller plus loin :
- Science des systèmes complexes — Pertinent pour comprendre le cadre conceptuel proposé.
- Interprétabilité des modèles d’apprentissage automatique — Contexte sur les approches d’interprétabilité.
- Attention (apprentissage automatique) — Pour approfondir le mécanisme d’attention mentionné.
120 mots
Profil radar
Le profil radar montre une bonne qualité d'information et une fiabilité élevée, avec un niveau technique modéré. La quantité d'information est importante, mais la note globale est légèrement inférieure en raison de la nature spéculative de certaines hypothèses.
💬 Sur les 0 commentaires analysés, aucune tendance n'est disponible.