The State of Deep Research | AI for Good New York

The State of Deep Research | AI for Good New York

🎙 Minh Trinh 👥 356 📅 23 octobre 2025 ⏱ 49 min 👁 66 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

deep researchagentsbenchmarksraisonnementLLM

Résumé

Cette présentation, donnée lors de l’événement AI for Good à New York, dresse un panorama des systèmes de deep research, c’est-à-dire des agents IA capables de mener des recherches autonomes et approfondies. L’auteur commence par définir le concept en s’appuyant sur les définitions fournies par les principaux acteurs (Claude, OpenAI, Gemini, Perplexity). Il détaille ensuite les mécanismes sous-jacents, notamment l’apprentissage par renforcement, illustré par DeepSeek R1, et les architectures multi-agents comme AutoGen, MetaGPT, ManuSearch ou DeepResearcher. La présentation passe en revue plusieurs benchmarks utilisés pour évaluer ces systèmes : GPQA, GAIA, Humanity’s Last Exam, WebArena, The Agent Company et BrowseComp. Elle aborde également les risques et limites, tels que les biais, les hallucinations et la dépendance aux sources. Enfin, l’auteur évoque les tendances futures, notamment les protocoles MCP et A2A, et conclut sur l’importance de la supervision humaine. L’exposé est structuré et fournit une vue d’ensemble utile, mais reste généraliste et ne fournit pas d’analyse critique approfondie.

157 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est bonne : l’auteur couvre un large éventail de sujets, des définitions aux benchmarks, en passant par les architectures techniques. Il cite des exemples concrets et des références académiques, ce qui renforce la crédibilité. L’argumentation est globalement solide, mais parfois spéculative, notamment lorsqu’il évoque les méthodes internes d’OpenAI ou d’Anthropic. Il souligne à juste titre les limites des benchmarks (fuite de données, saturation) et les risques des systèmes autonomes. Cependant, l’analyse critique reste superficielle et ne discute pas en profondeur des implications éthiques ou sociétales.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : l’auteur s’appuie sur des sources variées (papiers de recherche, produits commerciaux) mais ne fournit pas de vérification indépendante. Il mentionne des benchmarks et des modèles, mais sans donner de chiffres précis de performance, ce qui limite la portée de l’évaluation. L’adéquation titre/contenu est bonne : le titre reflète bien le contenu. Les sources citées sont principalement des liens vers des produits ou des papiers, mais la description ne contient qu’un lien vers rodeo.ai, qui est une plateforme de livres, et non une source scientifique directe.

195 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : il s'agit d'un état des lieux des systèmes de deep research, de leurs benchmarks, applications et limites.

Qualité & fiabilité

7/10

Exposé structuré et informatif, s'appuyant sur des références académiques et des produits commerciaux, mais sans vérification indépendante des affirmations et avec une part de spéculation sur les méthodes internes des fournisseurs.

Moments clés

Sources citées

  • rodeo.ai — Plateforme de l'auteur pour ses livres sur les agents IA, mentionnée en fin de vidéo.

Sources concordantes

  • DeepSeek-R1 — L'auteur mentionne DeepSeek R1 comme un modèle clé pour le raisonnement par renforcement.
  • GAIA benchmark — L'auteur cite GAIA comme un benchmark pour évaluer les assistants IA.
  • Humanity's Last Exam — L'auteur mentionne ce benchmark comme un défi pour les modèles.
  • WebArena — L'auteur le présente comme un benchmark pour les agents dans des environnements web.

Apport & nouveautés

L’apport principal de cette vidéo est de fournir une synthèse accessible et structurée de l’état de l’art du deep research, en reliant les concepts académiques (apprentissage par renforcement, benchmarks) aux produits commerciaux. Elle met en lumière les évolutions récentes et les défis à venir. Cependant, elle ne présente pas de résultats originaux ni d’analyse approfondie.

Pour aller plus loin :

  • DeepSeek-R1 — Article fondateur sur le modèle de raisonnement open source.
  • GAIA benchmark — Benchmark pour évaluer les assistants IA sur des tâches réelles.
  • Humanity’s Last Exam — Benchmark conçu pour être difficile pour les modèles avancés.
  • WebArena — Environnement pour tester les agents autonomes sur des tâches web.
  • Model Context Protocol — Protocole standard pour l’intégration de contextes dans les agents.

122 mots

Profil radar

Le profil radar montre des scores élevés en quantité d'information et en niveau technique, mais une fiabilité globale légèrement inférieure, reflétant un contenu riche mais avec des affirmations non vérifiées. La qualité de l'information est bonne, mais l'absence de sources primaires détaillées limite la confiance.

Fiabilité 6/10