Building Effective Agents | Sushant Mehta, Google DeepMind

Building Effective Agents | Sushant Mehta, Google DeepMind

🎙 Sushant Mehta 👥 5K 📅 20 octobre 2025 ⏱ 35 min 👁 178 📄 conférence technique 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

agentsLLMpost-trainingworkflowsproduction

Résumé

Sushant Mehta, ingénieur senior chez Google DeepMind, présente une conférence sur la construction d’agents efficaces, enregistrée lors du MLOps World | GenAI Summit 2025. Il commence par expliquer l’importance du post-entraînement des grands modèles de langage (LLM) pour les rendre utiles dans des tâches réelles, en détaillant les étapes de fine-tuning, de récompense et d’apprentissage par renforcement. Il clarifie ensuite la distinction entre workflows (séquences prédéfinies) et agents (actions dynamiques et contextuelles), et souligne quand il est pertinent d’utiliser des agents (problèmes ouverts, imprévisibles) et quand il vaut mieux s’en passer (tâches simples ou prédictibles). Il présente les briques de base : LLM augmentés (avec outils et récupération), enchaînements de prompts avec validation, routage de modèles, et boucles évaluateur-optimiseur. Il insiste sur l’importance de critères de succès clairs, de boucles de rétroaction pour améliorer les agents, et de garde-fous pour limiter les coûts et la latence. Il recommande de commencer avec des API simples plutôt que des frameworks complexes pour mieux déboguer. Il conclut avec des exemples concrets comme les agents de support client et les agents de codage, et donne des conseils pratiques pour déployer des agents fiables en production.

191 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence offre une valeur pratique élevée : elle fournit des cadres de décision et des patterns concrets pour concevoir des agents efficaces, basés sur l’expérience de DeepMind. L’argumentation est solide, appuyée par des exemples concrets (agents de codage, support client) et des références à des travaux reconnus (Tulu, Llama, Nemotron). L’orateur adopte une approche pragmatique, évitant les promesses exagérées et soulignant les compromis (coût, latence, complexité). Il insiste sur l’importance de critères de succès mesurables et de boucles de rétroaction pour améliorer les agents, ce qui renforce la crédibilité de ses conseils.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur s’appuie sur des pratiques éprouvées et des références académiques et industrielles (Tulu, Llama, Nemotron). Il mentionne des pipelines de post-entraînement concrets et des techniques comme RLVR (RL avec récompenses vérifiables). Les sources ne sont pas toutes citées explicitement avec des URLs, mais les références sont suffisamment précises pour être identifiées. Le titre est en adéquation parfaite avec le contenu. La conférence ne comporte pas de publicité.

181 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : la conférence traite de la construction d'agents efficaces, avec des conseils pratiques et des patterns de conception.

Qualité & fiabilité

8/10

Conférence d'un ingénieur senior de Google DeepMind, s'appuyant sur des pratiques éprouvées et des exemples concrets. Les propos sont nuancés et pragmatiques, sans exagération. Les sources mentionnées (Tulu, Llama, Nemotron) sont des références reconnues dans le domaine.

Moments clés

Sources citées

  • MLOps World — Site de la conférence où la présentation a été enregistrée.

Sources concordantes

Apport & nouveautés

La conférence apporte une synthèse claire et pratique des patterns de conception d’agents, en insistant sur la distinction workflows/agents et sur l’importance du post-training. Elle propose un cadre de décision pour savoir quand utiliser des agents et comment les améliorer via des boucles de rétroaction. L’accent mis sur les récompenses vérifiables (RLVR) est particulièrement pertinent pour l’entraînement d’agents.

Pour aller plus loin :

  • RLHF (Reinforcement Learning from Human Feedback) — Pour comprendre les bases du RLHF, essentiel au post-training.
  • Direct Preference Optimization (DPO) — Une alternative à PPO pour l’alignement, mentionnée dans la conférence.
  • Tulu 2 — Modèle open-source d’AI2, exemple de pipeline de post-training.
  • Llama 3 — Modèle de Meta, avec un rapport de post-training détaillé.
  • Nemotron — Modèle de NVIDIA, autre exemple de pipeline.

126 mots

Profil radar

Le profil radar montre une bonne maîtrise du sujet avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est légèrement inférieur, indiquant une accessibilité relative pour un public averti.

Fiabilité 8/10

💬 Sur les 0 commentaires analysés, aucune tendance n'est observable.