De l’OCR au RAG : l’IA générative appliquée aux sources parlementaires françaises. Enjeux, méthodes et perspectives

De l’OCR au RAG : l’IA générative appliquée aux sources parlementaires françaises. Enjeux, méthodes et perspectives

🎙 Marie Puren 👥 63 📅 2 mars 2026 ⏱ 51 min 👁 28 📄 conférence 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

IA générativeRAGOCRhistoire parlementaireagenda-setting

Résumé

Marie Puren présente le projet DECIDONS, consacré à l’étude des débats parlementaires de la Troisième République française (1870-1940) et à l’analyse de la construction de l’agenda politique. Elle explique comment l’IA générative, notamment via les LLM et le RAG, peut être mobilisée pour traiter et interroger ces vastes corpus. La conférence détaille les étapes de la chaîne de traitement : numérisation, OCR, extraction d’informations, classification, et enfin analyse avec des méthodes d’IA générative. Elle aborde les avantages (extraction, structuration, résumé, interaction) et les limites (biais, hallucinations, reproductibilité, transparence) de ces technologies. Le projet s’appuie sur la théorie de l’agenda-setting pour tester l’influence de la presse sur les débats parlementaires. Puren insiste sur la nécessité d’une approche interdisciplinaire et sur l’importance de garder un contrôle critique sur les outils. Elle mentionne des solutions comme le RAG pour améliorer la fiabilité et la pertinence des réponses. La présentation se conclut sur les perspectives de recherche et l’ouverture vers de nouvelles méthodes pour les historiens.

162 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence apporte une valeur certaine en présentant un projet de recherche concret et novateur à l’intersection de l’histoire et de l’IA. L’argumentation est solide : elle s’appuie sur une problématique historique claire, des sources bien identifiées et une méthodologie réfléchie. L’utilisation de la théorie de l’agenda-setting est pertinente et bien expliquée. La discussion sur les limites des LLM est critique et nuancée, montrant une bonne connaissance des enjeux. Cependant, l’exposé reste à un niveau introductif et ne fournit pas de résultats détaillés, ce qui limite la portée de la démonstration.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : la conférencière cite des travaux académiques (notamment sur l’agenda-setting et l’impact de l’IA sur l’histoire) et s’appuie sur des sources primaires (débats parlementaires numérisés). La qualité des sources est élevée, mais les références précises ne sont pas toutes fournies dans la transcription. L’adéquation entre le titre et le contenu est excellente : la conférence couvre bien le parcours de l’OCR au RAG. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

189 mots

Adéquation titre / contenu

Le titre reflète parfaitement le contenu : la conférence couvre l'ensemble de la chaîne de traitement, de l'OCR au RAG, appliquée aux sources parlementaires.

Qualité & fiabilité

8/10

Conférence académique par une chercheuse reconnue, présentant un projet de recherche structuré avec une méthodologie explicite. Les limites et enjeux des LLM sont discutés de manière critique. La fiabilité est bonne, mais le projet n'est pas encore abouti et les résultats préliminaires ne sont pas détaillés.

Moments clés

Sources citées

  • Article de Frédéric Lav et Caroline Müller (2024) — Cité comme référence sur l'impact de l'IA sur le métier d'historien.
  • Livre de Caroline Müller (2025) — Cité comme prolongement de l'article précédent.

Sources concordantes

  • Article de Frédéric Lav et Caroline Müller (2024) — Converge avec l'idée que l'IA transforme les pratiques historiennes.

Apport & nouveautés

L’apport principal de cette conférence est de montrer comment l’IA générative peut être intégrée dans une recherche historique de grande ampleur, en proposant une méthodologie complète de l’OCR au RAG. Elle met en lumière les potentialités et les défis de ces outils pour l’analyse de corpus massifs, tout en insistant sur la nécessité d’une approche critique. Le projet DECIDONS est original par son échelle et son interdisciplinarité.

Pour aller plus loin :

106 mots

Profil radar

Le profil radar montre une conférence équilibrée, avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est bon, mais légèrement inférieur, ce qui reflète une présentation accessible tout en restant rigoureuse.

Fiabilité 8/10