LLM Inference: A Comparative Guide to Modern Open-Source Runtimes

LLM Inference: A Comparative Guide to Modern Open-Source Runtimes

🎙 Aleksandr Shirokov, Wildberries 👥 5K 📅 20 octobre 2025 ⏱ 51 min 👁 1K 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

vLLMTGITensorRT-LLMSGLangbenchmark

Résumé

Cette présentation, issue du MLOps World GenAI Summit 2025, propose un guide comparatif des runtimes open-source pour l’inférence de grands modèles de langage (LLM). L’orateur, Aleksandr Shirokov, team lead MLOps chez Wildberries, partage l’expérience de son équipe dans la construction d’une plateforme de serving en production. Après un rappel des métriques clés (latence, débit, utilisation mémoire), il présente leur benchmark maison qui évalue les performances, la qualité et les coûts. Il compare ensuite quatre frameworks majeurs : vLLM, TGI, TensorRT-LLM et SGLang, en soulignant leurs forces et faiblesses respectives. Il détaille plusieurs techniques d’optimisation : les backends d’attention (FlashAttention, FlashInfer), le speculative decoding, la gestion du cache KV et le chargement des poids. La seconde partie, présentée par Alexey Terasov, aborde l’utilisation de Kong comme passerelle API pour sécuriser, limiter et observer les accès aux modèles. Ils décrivent des solutions pour le scaling automatique (HPA) et le partage de GPU, notamment via HAM. Enfin, ils partagent des retours sur le déploiement de DeepSeek R1 en production, soulignant l’importance de benchmarks personnalisés et d’une infrastructure adaptée.

175 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens du MLOps : l’exposé s’appuie sur des retours d’expérience concrets en environnement de production, avec des benchmarks maison. L’argumentation est solide, structurée autour de métriques mesurables et de comparaisons de frameworks. L’orateur justifie ses choix par des données empiriques, même si certains résultats ne sont pas détaillés. La présentation est pragmatique, évitant les généralités et se concentrant sur des aspects opérationnels.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte : les propos sont étayés par des benchmarks internes, mais les détails méthodologiques sont limités. Les sources citées se limitent au site de la conférence, sans références académiques directes. Le titre est fidèle au contenu, qui est une comparaison pratique des runtimes. L’adéquation est bonne, sans exagération.

137 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : une comparaison pratique des runtimes open-source pour l'inférence LLM.

Qualité & fiabilité

7/10

Présentation technique basée sur l'expérience en production de Wildberries, avec des benchmarks maison. Les affirmations sont cohérentes avec l'état de l'art, mais certaines comparaisons manquent de détails méthodologiques précis.

Moments clés

Sources citées

  • MLOps World — Site de la conférence où la présentation a été donnée

Sources concordantes

Apport & nouveautés

L’apport principal est un retour d’expérience détaillé sur le choix et l’optimisation de runtimes d’inférence LLM en environnement de production, avec des benchmarks maison. La présentation met en lumière des solutions pratiques comme l’utilisation de HAM pour le partage de GPU et l’intégration de Kong pour la gestion des API.

Pour aller plus loin :

  • vLLM — Framework de serving LLM open-source, référence pour la comparaison.
  • TensorRT-LLM — Runtime optimisé par NVIDIA pour l’inférence LLM.
  • SGLang — Framework de serving avec des optimisations avancées.
  • FlashAttention — Backend d’attention optimisé, mentionné dans la vidéo.

93 mots

Profil radar

Le profil radar montre un niveau technique élevé et une bonne quantité d'informations, avec une fiabilité correcte. La qualité est bonne mais pourrait être renforcée par des références plus précises.

Fiabilité 7/10