LLMOps Infrastructure for Production-Grade Agentic RAG Applications with Union.ai

LLMOps Infrastructure for Production-Grade Agentic RAG Applications with Union.ai

🎙 Niels Bantilan 👥 5K 📅 28 septembre 2025 ⏱ 86 min 👁 203 📄 atelier 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

RAGLLMOpshyperparameter optimizationevaluationorchestration

Résumé

Cet atelier, animé par Niels Bantilan (Chief ML Engineer chez Union.ai), porte sur les aspects opérationnels et d’infrastructure nécessaires pour faire passer une application RAG (Retrieval-Augmented Generation) d’un prototype à une solution de production. L’orateur commence par présenter le contexte et les défis spécifiques aux applications RAG, notamment la gestion de l’hétérogénéité des calculs, les bases vectorielles, la création de jeux d’évaluation et l’hébergement de modèles. Il propose ensuite une approche systématique inspirée de l’optimisation des hyperparamètres en machine learning traditionnel, appliquée à l’ensemble du pipeline RAG. La démonstration pratique utilise la plateforme Union.ai et un notebook Colab pour construire un chatbot basé sur la documentation de pandas. Les étapes clés incluent la création d’une base de connaissances, la construction d’un vector store, la génération d’un jeu d’évaluation avec LLM-as-a-judge, et l’exécution de campagnes d’optimisation d’hyperparamètres. L’accent est mis sur l’importance de l’évaluation continue et de l’orchestration pour maintenir la performance en production. L’atelier se conclut par des conseils pratiques pour transférer ces compétences à d’autres contextes.

167 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens cherchant à industrialiser des applications RAG. L’argumentation est solide, s’appuyant sur une expérience concrète et des démonstrations en direct. L’orateur justifie clairement l’importance de traiter le pipeline RAG comme un système composé, avec des hyperparamètres à optimiser, plutôt que de se concentrer uniquement sur le modèle. Il fournit des exemples concrets et des bonnes pratiques, comme l’utilisation de LLM-as-a-judge pour l’évaluation, et insiste sur la nécessité d’une itération continue. La démonstration pas à pas renforce la crédibilité de l’approche.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des outils open source (Flyte, Pandera) et des concepts éprouvés (HPO, évaluation). Les sources mentionnées sont principalement les outils utilisés (Union.ai, Flyte, Pandera) et des références générales à des techniques RAG. Le titre mentionne ‘Agentic RAG’ mais le contenu se concentre davantage sur les aspects LLMOps et l’infrastructure, avec une brève mention des systèmes agentiques. Cette légère inadéquation n’affecte pas la qualité globale du contenu.

176 mots

Adéquation titre / contenu

Le titre est légèrement trompeur car il mentionne 'Agentic RAG' alors que le contenu se concentre principalement sur les aspects LLMOps et l'infrastructure pour faire passer RAG de la démo à la production, avec une brève mention des systèmes agentiques.

Qualité & fiabilité

8/10

Contenu présenté par un expert reconnu (Chief ML Engineer chez Union.ai, créateur de Pandera, mainteneur de Flyte), avec une approche pratique et reproductible. Les concepts sont étayés par des exemples concrets et des démonstrations en direct. La fiabilité est élevée, bien que certaines affirmations générales sur les techniques RAG ne soient pas systématiquement sourcées.

Moments clés

Sources citées

  • Union.ai — Plateforme utilisée pour l'orchestration des workflows
  • Flyte — Outil open source d'orchestration de workflows mentionné comme fondation de Union
  • Pandera — Outil de validation de données créé par l'orateur

Sources concordantes

Apport & nouveautés

L’apport principal de cette vidéo est de fournir une méthodologie concrète pour appliquer l’optimisation des hyperparamètres (HPO) aux pipelines RAG, en les traitant comme des systèmes composés. L’orateur détaille les étapes pour créer un jeu d’évaluation, définir des métriques, et orchestrer des campagnes d’optimisation. Cette approche est originale car elle transpose des techniques classiques de ML à des systèmes d’IA générative, en mettant l’accent sur l’infrastructure et l’opérationnalisation.

Pour aller plus loin :

105 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité, avec un niveau technique modéré. Cela indique un contenu dense et fiable, mais nécessitant un certain niveau de connaissances préalables en ML et en orchestration.

Fiabilité 8/10