Qu’est-ce qu’un texte scientifique à l’époque des LLMs?

Qu’est-ce qu’un texte scientifique à l’époque des LLMs?

🎙 Marcello Vitali-Rosati 👥 251 📅 19 décembre 2025 ⏱ 37 min 👁 151 📄 conférence 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

LLMtexteépistémologieéditorialisationXML

Résumé

Marcello Vitali-Rosati interroge la notion de texte scientifique à l’ère des grands modèles de langage (LLM). Il commence par critiquer l’usage flou du terme ‘intelligence artificielle’ et propose de se concentrer sur les LLM. Il explique le fonctionnement technique des LLM : tokenisation, plongements vectoriels, attention, et souligne que pour un LLM, un texte n’est qu’une série de caractères avec des relations statistiques. Il oppose cette vision réductrice à celle des sciences humaines, qui considèrent le texte comme une structure complexe et hiérarchisée. Il dénonce la naturalisation de ce modèle unique, notamment à travers les formats dominants comme OOXML (Microsoft Word), qui imposent une certaine philosophie du texte. Il présente des alternatives comme TEI/XML et LaTeX, en soulignant leurs différences épistémologiques. Il illustre son propos avec l’exemple d’Exdosis, un outil pour l’édition critique, qui incarne une lecture experte. Il conclut en plaidant pour la préservation d’une multiplicité d’approches épistémologiques du texte, menacée par la convergence imposée par quelques entreprises.

159 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence offre une réflexion originale et stimulante sur l’impact des LLM sur la conception du texte. L’argumentation est solide, s’appuyant sur des exemples concrets (fonctionnement des LLM, formats de fichiers) et des références théoriques (structuralisme, philologie). L’auteur défend une position nuancée, reconnaissant l’intérêt des LLM tout en alertant sur les risques d’uniformisation. La démonstration est bien construite, passant de la technique à la philosophie, et aboutit à un appel à la diversité épistémologique.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’auteur cite des travaux (Firth, DeRose, TEI) et des exemples précis (Exdosis). Cependant, certaines affirmations techniques sur les LLM sont simplifiées et pourraient être précisées. Les sources mentionnées ne sont pas toutes référencées explicitement, mais les liens de la description renvoient au séminaire. L’adéquation titre/contenu est excellente, le titre annonçant clairement la problématique traitée.

149 mots

Adéquation titre / contenu

Le titre est parfaitement adéquat : la conférence interroge précisément la nature du texte scientifique à l'ère des LLM, en confrontant les modèles computationnels et les approches des sciences humaines.

Qualité & fiabilité

8/10

Exposé théorique structuré, s'appuyant sur des références explicites (Firth, DeRose, TEI, exemples concrets) et une argumentation nuancée. Quelques approximations techniques (ex. sur le fonctionnement des LLM) mais globalement fiable.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

L’apport original de cette conférence est de mettre en lumière la dimension épistémologique des formats et des modèles computationnels, en montrant que les LLM ne sont pas neutres mais porteurs d’une certaine conception du texte. Il propose une réflexion critique sur la naturalisation de ces modèles et plaide pour une diversité des approches.

Pour aller plus loin :

  • Théorie de l’éditorialisation — Concept clé développé par l’auteur, pertinent pour comprendre les enjeux de la production de texte en environnement numérique.
  • Text Encoding Initiative (TEI) — Standard pour l’encodage des textes en sciences humaines, discuté dans la conférence.
  • Hypothèse distributionnelle — Fondement théorique des LLM, mentionné par l’auteur.

107 mots

Profil radar

Le profil radar montre une bonne qualité d'information et une fiabilité globale élevée, avec une quantité d'information moyenne et un niveau technique correct. La conférence est bien équilibrée entre contenu théorique et exemples concrets.

Fiabilité 8/10