What’s Next in the Agent Stack | Shelby Heinecke, Salesforce

What’s Next in the Agent Stack | Shelby Heinecke, Salesforce

🎙 Shelby Heinecke 👥 5K 📅 20 octobre 2025 ⏱ 31 min 👁 56 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

agentsmodèles d'actionpetits modèlesMCPévaluation

Résumé

Shelby Heinecke, Senior AI Research Manager chez Salesforce, présente lors du MLOps World | GenAI Summit 2025 les innovations de son équipe pour faire passer les agents IA du prototype à la production. Elle introduit le concept de « vague 3.5 » de l’IA, centré sur l’« intelligence générale d’entreprise ». La conférence détaille quatre outils open source développés par Salesforce : les modèles d’action (xLAM) qui génèrent des appels de fonction, avec des versions de 1, 3 et 8 milliards de paramètres, entraînés sur des données d’action synthétiques générées par le pipeline APIgen ; TACO, un modèle d’action multimodal qui combine raisonnement et actions pour traiter des images ; MCPEval, un framework d’évaluation des agents sur les serveurs MCP ; et Promptomatix, un outil d’optimisation de prompts pour la production. L’accent est mis sur la réduction de la latence, l’amélioration de la fiabilité et l’adaptation aux environnements d’entreprise. Heinecke souligne l’importance des petits modèles pour la confidentialité, le coût et la latence, et insiste sur la nécessité d’évaluer les agents sur des scénarios réels. Elle fournit des liens vers les ressources open source pour chaque outil.

187 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La conférence apporte une valeur certaine en présentant des outils concrets et open source pour la mise en production d’agents IA. L’argumentation est structurée autour de la nécessité de relever les défis de latence, de fiabilité et d’évaluation. Heinecke justifie l’importance des petits modèles par des arguments de coût, de latence et de confidentialité, et illustre ses propos avec des exemples concrets (comme la question sur le numéro du motard). La démonstration s’appuie sur des résultats de recherche, mais reste promotionnelle, sans comparaison approfondie avec d’autres solutions existantes.

95 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : la conférence explore les composants émergents de la pile d'agents, en se concentrant sur les outils développés par Salesforce.

Qualité & fiabilité

7/10

Présentation par une chercheuse senior de Salesforce, s'appuyant sur des travaux de recherche internes publiés et open source. Les informations sont précises et techniques, mais la présentation est orientée vers la promotion des outils de Salesforce, sans recul critique ni comparaison exhaustive avec d'autres approches.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

La conférence présente des outils open source récents de Salesforce pour la mise en production d’agents IA, notamment des modèles d’action de petite taille, un pipeline de génération de données synthétiques, un framework d’évaluation pour MCP et un outil d’optimisation de prompts. Ces contributions sont originales dans la mesure où elles abordent des aspects pratiques souvent négligés dans la recherche académique.

Pour aller plus loin :

  • Model Context Protocol (MCP) — Protocole standardisé pour connecter des agents à des outils et API, central dans la présentation.
  • Function Calling in LLMs — Article d’OpenAI sur l’appel de fonctions, concept clé des modèles d’action.
  • Chain-of-Thought Prompting — Article fondateur sur le raisonnement en chaîne de pensée, utilisé dans TACO.
  • Small Language Models — Article sur l’efficacité des petits modèles de langage, pertinent pour la discussion sur les modèles d’action.

137 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique correct, mais une fiabilité globale modérée en raison du caractère promotionnel de la présentation. La qualité de l'information est bonne, mais l'absence de sources externes détaillées limite la vérifiabilité.

Fiabilité 7/10