RAG: The 2025 Best-Practice Stack, Prototype to Production

RAG: The 2025 Best-Practice Stack, Prototype to Production

🎙 Greg Loughnane, Chris Alexiuk 👥 5K 📅 25 septembre 2025 ⏱ 172 min 👁 394 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

RAGstackLangGraphQdrantRAGAS

Résumé

Cette vidéo, animée par Greg Loughnane et Chris Alexiuk, cofondateurs d’AI Makerspace, présente leur stack recommandée pour construire des applications RAG (Retrieval-Augmented Generation) en production en 2025. Ils commencent par rappeler les bases du RAG : la récupération de documents pertinents, l’augmentation du prompt avec ces documents, et la génération de la réponse. Ils insistent sur l’importance d’éviter les hallucinations en fournissant des sources fiables. Ensuite, ils détaillent leur stack : LangGraph pour l’orchestration, Qdrant comme base de données vectorielle, Cohere Rerank pour le re-ranking, RAGAS pour l’évaluation, Together AI pour le serving de modèles, et des modèles comme Llama 3.3 70B et un modèle d’embedding multilingue. Ils expliquent les raisons de ces choix, notamment la flexibilité, la performance et la facilité de passage en production. La vidéo inclut une démonstration de code pour construire une application RAG simple, avec des phases de déploiement allant du prototype sur site à la mise à l’échelle dans le cloud. Ils abordent également les défis de l’entreprise, comme la préparation des données et la validation, et recommandent une approche itérative avec un monitoring via LangSmith. Enfin, ils mentionnent des alternatives comme CrewAI sur AWS et soulignent l’importance de l’évaluation continue.

197 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens cherchant à implémenter un RAG en production. Les intervenants partagent des recommandations concrètes basées sur leur expérience avec des clients et des étudiants. L’argumentation est solide : ils justifient chaque choix par des critères de performance, de flexibilité et de facilité d’utilisation. Par exemple, ils préfèrent LangGraph pour sa capacité à passer du prototype à la production, et Qdrant pour sa scalabilité et son support GPU. Ils insistent sur l’importance du re-ranking et de l’évaluation avec RAGAS, ce qui est une bonne pratique. Cependant, certaines affirmations sont subjectives, comme la supériorité de Cohere Rerank, sans comparaison quantitative. La démonstration de code est pratique et illustre bien les concepts.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte : les intervenants citent des références comme l’article A16Z sur la stack LLM et le papier GPT-3 sur l’in-context learning. Ils mentionnent des outils open-source et des frameworks reconnus. Cependant, ils ne fournissent pas de sources formelles pour étayer leurs choix, se basant sur leur expérience. Le titre est adéquat : il annonce une stack de bonnes pratiques pour le RAG, ce qui est bien le sujet. La description de la vidéo est détaillée et correspond au contenu. Les commentaires ne sont pas fournis, donc aucune analyse des tendances n’est possible.

228 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : la vidéo présente une stack recommandée pour le RAG en production, avec des phases de déploiement.

Qualité & fiabilité

7/10

Les intervenants sont des praticiens reconnus (CEO/CTO d'AI Makerspace, Developer Advocate chez NVIDIA) et présentent une stack cohérente avec des outils open-source. La démonstration est ancrée dans l'expérience, mais les affirmations sur la supériorité des outils reposent sur des avis d'experts sans études comparatives formelles.

Moments clés

Sources citées

  • AI Engineering Bootcamp — Formation proposée par AI Makerspace, mentionnée comme ressource pour approfondir les compétences en ingénierie IA.

Sources concordantes

  • The LLM Stack — Article d'a16z cité dans la vidéo pour décrire les composants d'une application LLM.

Apport & nouveautés

La vidéo apporte une synthèse pratique des outils actuels pour le RAG en production, avec des recommandations claires et une démonstration de code. Elle se distingue par son approche orientée ‘best-practice’ et son focus sur le passage du prototype à la production. L’accent mis sur l’évaluation avec RAGAS et le monitoring avec LangSmith est pertinent pour les équipes cherchant à industrialiser leurs applications.

Pour aller plus loin :

121 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique élevé, mais une fiabilité globale modérée en raison de l'absence de sources formelles. La qualité de l'information est correcte, mais l'argumentation repose sur l'expérience plutôt que sur des études comparatives.

Fiabilité 7/10