Agentic vs. Vector Search: An Eval-Driven Approach to Coding Agent Performance

Agentic vs. Vector Search: An Eval-Driven Approach to Coding Agent Performance

🎙 Jessica Wang 👥 5K 📅 11 août 2026 ⏱ 29 min 👁 5 📄 étude originale 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

evalsagentic searchvector searchClaude CodeBraintrust

Résumé

La conférence de Jessica Wang, ingénieure DevRel chez Braintrust, présente une introduction aux évaluations (evals) pour les systèmes d’IA, puis une étude de cas comparative entre la recherche agentique et la recherche vectorielle pour des agents de codage. Elle commence par expliquer l’importance des evals pour remplacer les décisions basées sur l’intuition par des mesures quantitatives. Elle détaille les quatre composantes d’un eval : le jeu de données, la tâche, le système de notation et les expériences. Ensuite, elle décrit la méthodologie de son étude : à partir de deux référentiels de code (Microsoft TypeScript Go et Django via SWE-bench), elle a synthétisé des tickets de bugs à partir de PR corrigées, puis a demandé à Claude Code de les résoudre en utilisant soit la recherche agentique (par défaut) soit une recherche vectorielle implémentée sur mesure, en bloquant les outils agentiques pour cette dernière. Le score est binaire : 100% si les tests passent, 0% sinon. Les résultats montrent une précision similaire (~70%) mais un coût et une consommation de tokens environ cinq fois supérieurs pour la recherche vectorielle. L’analyse des traces révèle que la recherche vectorielle renvoie de nombreux extraits de code proches du bug mais sans le contexte nécessaire, obligeant l’agent à de multiples tentatives, tandis que la recherche agentique suit les chaînes d’importation et résout la tâche plus efficacement. Jessica souligne les limites de son étude (petit échantillon, implémentation vectorielle rudimentaire, non-déterminisme des LLM) et propose des améliorations : multiplier les essais, améliorer l’implémentation vectorielle, tester une approche hybride, et élargir le jeu de données. Elle conclut en insistant sur l’importance des evals comme processus itératif et collaboratif.

271 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens de l’IA : la présentation fournit un cadre concret pour construire des evals, avec des exemples de code et des pièges pratiques (traçage des sous-processus, blocage des outils). L’argumentation est solide : elle s’appuie sur une étude de cas réelle, avec une méthodologie transparente et des limites clairement énoncées. La comparaison entre recherche agentique et vectorielle est pertinente et les résultats, bien que préliminaires, sont interprétés avec nuance. L’accent mis sur l’importance des traces pour le débogage est particulièrement utile.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte : la méthodologie est détaillée, les sources sont mentionnées (article de Cursor, SWE-bench, référentiels GitHub), et les limites sont reconnues. Cependant, l’étude n’est pas publiée ni évaluée par des pairs, et l’échantillon est très restreint. Le titre est fidèle au contenu. La conférencière travaille pour Braintrust, ce qui pourrait introduire un biais promotionnel, mais elle ne fait pas de promotion excessive et présente des résultats nuancés.

175 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : la présentation compare effectivement la recherche agentique et vectorielle pour des agents de codage, en adoptant une approche basée sur les évaluations.

Qualité & fiabilité

7/10

La conférencière est ingénieure DevRel chez Braintrust, avec une expérience en ingénierie logicielle chez Microsoft et DoorDash. La méthodologie est détaillée et transparente, mais l'étude repose sur un petit échantillon (10 et 25 cas) et une seule exécution, ce qui limite la robustesse statistique. Les résultats sont présentés avec des réserves explicites.

Moments clés

Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.

Sources citées

  • Article de Cursor sur la recherche agentique — Mentionné comme source d'inspiration pour l'étude comparative.
  • SWE-bench — Référentiel de référence pour l'évaluation des modèles de codage, utilisé pour le second dataset.
  • Dépôt Microsoft TypeScript Go — Référentiel de code source utilisé pour le premier dataset.

Sources concordantes

  • Article de Cursor sur la recherche agentique — Mentionné comme source d'inspiration pour l'étude comparative.
  • SWE-bench — Référentiel de référence pour l'évaluation des modèles de codage, utilisé pour le second dataset.

Apport & nouveautés

L’apport principal est une étude de cas pratique et reproductible comparant deux approches de recherche pour des agents de codage, avec une méthodologie claire et des résultats chiffrés. L’originalité réside dans l’utilisation d’un eval structuré pour guider une décision d’ingénierie, et dans l’analyse fine des traces pour comprendre les différences de performance. Les limites sont honnêtement reconnues, ce qui renforce la crédibilité.

Pour aller plus loin :

  • SWE-bench — Référence pour l’évaluation des agents de codage, utilisé dans l’étude.
  • Claude Code — Documentation de l’outil d’Anthropic utilisé pour l’implémentation.
  • Braintrust — Plateforme d’évaluation et d’observabilité pour l’IA, utilisée dans l’étude.
  • Recherche vectorielle — Concept de base pour comprendre la recherche vectorielle.

111 mots

Profil radar

Le profil radar montre un bon équilibre entre la quantité d'informations, la qualité et le niveau technique, avec une fiabilité légèrement inférieure en raison de la petite taille de l'échantillon et de l'absence de validation externe. La note globale de 4/5 reflète une présentation solide mais perfectible.

Fiabilité 7/10

💬 Sur les 0 commentaires analysés, aucune tendance n'est observable.