A Pragmatist’s Guide to Building Knowledge Graphs from Unstructured Data

A Pragmatist’s Guide to Building Knowledge Graphs from Unstructured Data

🎙 Alessandro Pireno 👥 5K 📅 21 octobre 2025 ⏱ 25 min 👁 155 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

knowledge graphunstructured dataETLLLMNLPFastTextentity resolutionvector search

Résumé

Alessandro Pireno présente une approche pragmatique pour construire des graphes de connaissances à partir de données non structurées, en s’appuyant sur son expérience dans une startup de bases de données multimodèles. Il compare trois architectures : l’utilisation directe de LLM, les méthodes NLP traditionnelles, et les approches hybrides intégrant la recherche vectorielle. Il souligne les compromis en termes de coût, latence, précision et explicabilité. Il propose une technique novatrice de résolution d’entités utilisant des embeddings FastText entraînés de manière supervisée pour aligner les entités extraites sur des données de référence. Il recommande une architecture en entonnoir combinant NLP et petits modèles de langage (SLM) pour la précision, avec des LLM utilisés pour l’amélioration continue du système. L’accent est mis sur la scalabilité, la réduction des faux positifs et l’intégration de boucles de rétroaction pour améliorer les règles et les modèles.

140 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public technique : l’orateur partage des retours d’expérience concrets et des comparaisons pratiques entre approches. L’argumentation est solide, appuyée par des exemples concrets (documents financiers, résolution d’entités) et des considérations opérationnelles (coût, latence, explicabilité). Il propose une architecture hybride originale qui combine les forces du NLP et des LLM, avec une boucle d’amélioration continue. La démonstration est claire et structurée, même si certaines affirmations (comme les performances comparées) manquent de données chiffrées précises.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte pour une conférence technique : l’orateur s’appuie sur son expérience et des outils reconnus (spaCy, FastText), mais ne cite pas de sources académiques ou de benchmarks détaillés. La qualité des sources est donc moyenne, mais les techniques présentées sont éprouvées. L’adéquation titre/contenu est bonne : le titre reflète bien le contenu pragmatique et orienté pratique. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

171 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : l'orateur propose un guide pragmatique basé sur son expérience pour construire des graphes de connaissances à partir de données non structurées.

Qualité & fiabilité

7/10

Présentation d'architectures et de techniques concrètes (NLP, LLM, embeddings FastText) avec comparaison empirique, mais sans données chiffrées détaillées ni références académiques explicites.

Moments clés

Sources citées

  • MLOps World — Conférence où la présentation a été enregistrée.

Sources concordantes

  • MLOps World — Conférence où la présentation a été enregistrée.

Apport & nouveautés

L’apport original réside dans la proposition d’une architecture hybride pour la construction de graphes de connaissances, combinant NLP, SLM et LLM de manière pragmatique, avec une boucle d’amélioration continue. L’utilisation d’embeddings FastText pour la résolution d’entités comme problème de classification supervisée est une technique intéressante et peu courante.

Pour aller plus loin :

  • Knowledge graph — Concepts de base des graphes de connaissances.
  • FastText — Bibliothèque pour embeddings de mots, utilisée dans la présentation.
  • spaCy — Bibliothèque NLP utilisée pour l’extraction d’entités et de relations.
  • Retrieval-augmented generation — Contexte sur l’utilisation des graphes pour améliorer les LLM.

97 mots

Profil radar

Le profil radar montre des scores équilibrés autour de 7, indiquant une bonne qualité globale, avec une légère prédominance de la quantité d'information et de la fiabilité. La vidéo est donc fiable et informative, mais sans excellence particulière dans un domaine précis.

Fiabilité 7/10