LLMs in Science: The Good, The Bad and The Ugly

LLMs in Science: The Good, The Bad and The Ugly

🎙 Nihar Shah 👥 4K 📅 9 décembre 2025 ⏱ 66 min 👁 61 📄 revue de littérature 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

LLMpeer reviewfraudeattribution de relecteursévaluation scientifique

Résumé

Nihar Shah, professeur à Carnegie Mellon, présente une conférence sur l’utilisation des grands modèles de langage (LLM) dans le processus scientifique, structurée en trois parties. La première partie, ‘Le bon’, examine comment les LLM peuvent aider à détecter des erreurs dans les articles scientifiques. Shah décrit une expérience où des erreurs ont été insérées dans un article et envoyées à 79 relecteurs humains : seulement un a détecté l’erreur subtile. En comparaison, GPT-4 a identifié l’erreur évidente systématiquement, mais a échoué sur les erreurs plus subtiles sans guidage. La deuxième partie, ‘Le mauvais’, aborde les vulnérabilités du processus de relecture face à la fraude, notamment l’usurpation d’identité et les collusions. Shah présente des données montrant que des profils fictifs ont été créés pour obtenir des articles à relire, et que les systèmes d’attribution basés sur le texte peuvent être manipulés. La troisième partie, ‘Le laid’, traite des pièges méthodologiques des ‘scientifiques IA’ autonomes, bien que cette partie soit moins détaillée dans la transcription. La conférence souligne l’importance d’évaluer rigoureusement l’utilisation des LLM dans la science, en tenant compte des biais et des risques de fraude.

185 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : Shah présente des données expérimentales originales issues de conférences de premier plan (NeurIPS, ICML), avec des protocoles contrôlés (randomisation, IRB). L’argumentation est solide, appuyée par des exemples concrets et des comparaisons chiffrées. Il discute également des limites de ses études, comme la généralisabilité. La structure en trois parties est claire et efficace.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les expériences sont décrites avec précision, les résultats sont nuancés, et les limites sont mentionnées. Les sources ne sont pas toutes citées explicitement dans la transcription, mais Shah fait référence à des travaux publiés. L’adéquation titre/contenu est bonne, le titre reflétant bien la structure. Aucun commentaire n’est fourni pour analyse.

130 mots

Adéquation titre / contenu

Le titre reflète bien la structure en trois parties (bon, mauvais, laid) et le contenu traite effectivement de l'utilisation des LLM en science.

Qualité & fiabilité

8/10

Exposé d'un chercheur reconnu, s'appuyant sur des expériences contrôlées publiées dans des conférences majeures (NeurIPS, ICML). Les résultats sont présentés avec nuances et limites. Quelques affirmations manquent de détails chiffrés complets, mais l'ensemble est rigoureux.

Moments clés

Sources citées

  • Paper on AI reviewers (non spécifié) — Shah mentionne des travaux sur l'évaluation des relecteurs IA, mais sans référence précise dans la transcription.
  • Expérience NeurIPS 2022 sur l'évaluation des reviews — Shah décrit une expérience menée à NeurIPS 2022 sur les biais des auteurs dans l'évaluation des reviews.
  • Étude sur les profils fictifs dans OpenReview — Shah mentionne une investigation ayant trouvé 94 profils fictifs dans OpenReview.

Sources concordantes

  • Études sur les biais des auteurs dans l'évaluation des reviews — Les résultats de Shah sur le biais des auteurs sont cohérents avec d'autres travaux sur les biais cognitifs dans l'évaluation par les pairs.
  • Travaux sur la robustesse des systèmes de matching texte — Les vulnérabilités des systèmes de matching texte sont documentées dans la littérature sur la sécurité des systèmes de recommandation.

Sources discordantes

  • Études montrant une meilleure performance des LLM dans la détection d'erreurs — Certaines études récentes suggèrent que les LLM peuvent détecter des erreurs avec des prompts plus sophistiqués, ce qui contraste avec les résultats de Shah.

Apport & nouveautés

L’apport principal est la mise en évidence expérimentale des limites des LLM dans la détection d’erreurs subtiles, et la démonstration que les systèmes d’attribution de relecteurs sont vulnérables à la manipulation. La conférence propose une approche centrée sur les objectifs du peer review (correction et intérêt) plutôt que sur la simple comparaison avec les évaluations humaines.

Pour aller plus loin :

  • Peer review — Contexte général sur l’évaluation par les pairs.
  • Large language model — Définition et enjeux des LLM.
  • Scientific fraud — Typologie des fraudes scientifiques.
  • NeurIPS — Conférence de référence en IA, lieu des expériences citées.
  • OpenReview — Plateforme utilisée pour les expériences sur les profils fictifs.

109 mots

Profil radar

Le profil radar montre une bonne qualité d'information et une fiabilité élevée, mais un niveau technique modéré, ce qui reflète une présentation accessible avec des exemples concrets. La quantité d'information est satisfaisante, mais la conférence aurait pu approfondir certains points.

Fiabilité 8/10