From Vectors to Agents: Managing RAG in an Agentic World

From Vectors to Agents: Managing RAG in an Agentic World

🎙 Rajiv Shah 👥 5K 📅 23 octobre 2025 ⏱ 85 min 👁 153 📄 conférence technique 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

RAGagenticretrievalBM25embeddings

Résumé

Cette conférence de Rajiv Shah, enregistrée au MLOps World 2025, propose une analyse approfondie des architectures RAG (Retrieval-Augmented Generation) et de leur évolution vers des systèmes agentiques. L’orateur commence par rappeler les bases du RAG (chunking, embeddings, similarité sémantique) et les défis de passage en production (précision, latence, coût, conformité). Il insiste sur l’importance de bien définir le cas d’usage et les compromis entre latence, coût et complexité du problème. Il détaille ensuite trois approches de retrieval : BM25 (recherche par mots-clés, rapide et robuste), les modèles de langage avec embeddings (sémantique, contextualisés) et la recherche agentique (multi-étapes, raisonnement). Il présente des benchmarks (MTEB, RTEB) pour choisir les modèles d’embedding, et souligne que BM25 reste un baseline fort. Il introduit un framework pour choisir entre trois architectures : Speedy Retrieval (500 ms), Accuracy-Optimized RAG (10 s) et Exhaustive Agentic Search. Il aborde également la gestion du contexte, l’orchestration et les coûts. La conférence se conclut par des conseils pratiques pour concevoir des systèmes RAG évolutifs et robustes, en insistant sur l’importance de l’évaluation et de la compréhension des besoins métier.

180 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’orateur, fort d’une expérience pratique, fournit des repères concrets (temps de latence, coûts, benchmarks) et des frameworks actionnables. L’argumentation est solide, appuyée sur des exemples réels et des comparaisons chiffrées. Il évite le jargon excessif et adopte une approche pragmatique, reconnaissant les limites de chaque méthode. La discussion sur les compromis (vitesse vs précision) est particulièrement pertinente pour les praticiens.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des benchmarks reconnus (MTEB, RTEB) et des modèles spécifiques (Qwen3, NV-Embed). Il mentionne des implémentations open-source (BM25 en Python) et des ressources comme Hugging Face. Cependant, certaines affirmations (comme l’origine du nom BM25) ne sont pas sourcées précisément. Le titre est fidèle au contenu, qui couvre bien la transition des vecteurs vers les agents. Aucun commentaire n’a été fourni, donc aucune analyse des tendances du public n’est possible.

158 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : la conférence couvre l'évolution du RAG vers des systèmes agentiques, avec un focus sur la gestion pratique en production.

Qualité & fiabilité

8/10

Conférence technique de haut niveau par un expert reconnu (Chief Evangelist chez Contextual AI), avec exemples concrets, benchmarks et références à des outils standards (MTEB, RTEB). Approche pragmatique et nuancée, sans surpromesses. Quelques limites : pas de démonstration en direct, certaines affirmations générales non sourcées précisément.

Moments clés

Sources citées

  • MLOps World — Conférence où la présentation a été enregistrée.

Sources concordantes

  • MTEB Leaderboard — Référence pour évaluer les modèles d'embedding, mentionnée dans la vidéo.
  • RTEB Leaderboard — Nouveau leaderboard avec jeu de données privé, mentionné dans la vidéo.

Apport & nouveautés

L’apport principal est un cadre pratique pour choisir entre différentes architectures RAG selon les besoins de latence, coût et complexité. L’orateur insiste sur l’importance de l’ingénierie de contexte et de l’évaluation, et démystifie le passage aux systèmes agentiques. Il fournit des repères chiffrés (500 ms, 10 s) et des recommandations concrètes.

Pour aller plus loin :

  • Retrieval-Augmented Generation (RAG) — Article Wikipédia sur le RAG, utile pour les bases.
  • BM25 — Page Wikipédia détaillant l’algorithme BM25.
  • MTEB Leaderboard — Leaderboard des modèles d’embedding sur Hugging Face.
  • RTEB Leaderboard — Leaderboard de retrieval avec jeu de données privé.
  • Contextual AI — Site de l’entreprise de l’orateur, pour plus d’informations sur les solutions RAG.

112 mots

Profil radar

Le profil radar montre un contenu équilibré avec des scores élevés en quantité, qualité et niveau technique, mais une fiabilité légèrement inférieure en raison de quelques affirmations non sourcées. La note globale de 4/5 reflète une excellente conférence pratique, mais sans démonstration en direct ni références académiques approfondies.

Fiabilité 8/10