A Practical Field Guide to Optimizing Cost, Speed & Accuracy of LLMs

A Practical Field Guide to Optimizing Cost, Speed & Accuracy of LLMs

🎙 Niels Bantilan 👥 5K 📅 20 octobre 2025 ⏱ 33 min 👁 46 📄 conférence technique 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

SLMLLMorchestrationcoûtlatence

Résumé

Cette conférence, présentée lors du MLOps World | GenAI Summit 2025, propose un guide pratique pour optimiser le coût, la vitesse et la précision des grands modèles de langage (LLM) dans le cadre d’agents spécialisés. L’orateur, Niels Bantilan, ingénieur ML en chef chez Union.ai, s’appuie sur le récent papier de Nvidia affirmant que les petits modèles de langage (SLM) sont l’avenir de l’IA agentique. Il explique que, contrairement aux LLM généralistes, les agents exécutent souvent des tâches répétitives et bien définies, pour lesquelles les SLM peuvent être suffisants et plus économiques. Il présente une stratégie en plusieurs étapes : identifier les points de bascule où remplacer un LLM par un SLM, maintenir la performance via des tests unitaires IA et des jeux de données synthétiques, optimiser la vitesse d’expérimentation (optimisation de prompts, fine-tuning), gérer les coûts grâce à une orchestration hétérogène (différents GPU selon les besoins), et optimiser la vitesse d’inférence (mise en cache, réutilisation de conteneurs). Il illustre son propos avec un exemple d’agent SQL et présente son outil, Flyte 2.0, comme solution d’orchestration. Il conclut en rappelant que les agents, comme les systèmes ML, nécessitent une infrastructure solide pour être efficaces en production.

195 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public technique : l’orateur fournit une méthodologie concrète et actionnable pour adopter des SLM en production, avec des exemples précis (agent SQL) et des références à des travaux récents (papier Nvidia). L’argumentation est solide, appuyée sur une expérience terrain et des retours d’utilisateurs. Il nuance ses propos en reconnaissant que les SLM ne conviennent pas à tous les cas et que leur adoption nécessite un investissement initial. La démonstration est structurée et progressive, même si certains points (comme les économies de coûts) auraient gagné à être chiffrés plus précisément.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte pour une conférence technique : l’orateur cite le papier de Nvidia sur les SLM, mentionne des benchmarks spécifiques (tool use) et s’appuie sur des retours d’expérience. Il ne fournit pas de sources détaillées dans la description, mais le lien vers le site de la conférence est présent. L’adéquation titre/contenu est bonne : le titre annonce un guide pratique, ce qui correspond au contenu. La qualité des sources est moyenne : aucune référence académique directe n’est donnée, mais les propos sont cohérents avec l’état de l’art.

202 mots

Adéquation titre / contenu

Le titre est fidèle au contenu : il s'agit bien d'un guide pratique pour optimiser coût, vitesse et précision des LLM, avec un focus sur les SLM.

Qualité & fiabilité

7/10

Conférence technique d'un expert en MLOps, s'appuyant sur des références (papier Nvidia, expériences terrain) et des exemples concrets. Les propos sont nuancés et pragmatiques, mais certaines affirmations (comme les économies de coûts) sont présentées sans données chiffrées détaillées. La fiabilité est bonne pour un retour d'expérience professionnel.

Moments clés

Sources citées

Sources concordantes

  • Nvidia position paper on SLMs — Papier cité par l'orateur comme motivation principale, mais non fourni en lien.

Apport & nouveautés

Cette présentation apporte une méthodologie concrète et structurée pour l’adoption de SLM en production, comblant un manque de guides pratiques dans ce domaine. Elle met en avant l’importance de l’orchestration hétérogène et des tests unitaires IA, et propose une approche progressive pour remplacer les LLM par des SLM sans perte de performance. L’originalité réside dans l’accent mis sur l’infrastructure et les pratiques MLOps plutôt que sur le simple choix du modèle.

Pour aller plus loin :

106 mots

Profil radar

Le profil radar montre une bonne qualité d'information et une fiabilité correcte, avec un niveau technique élevé. La quantité d'information est satisfaisante, mais la fiabilité globale est légèrement inférieure en raison du manque de sources détaillées.

Fiabilité 7/10