J'ai testé GPT-5 : vous aviez raison d'être sceptiques ...

J'ai testé GPT-5 : vous aviez raison d'être sceptiques ...

🎙 Vision IA 👥 294K 📅 12 août 2025 ⏱ 27 min 👁 40K 📄 revue d'actualité 🧭 2026-08-21
Disponible en : Français (actuel) English

Mots-clés

GPT-5comparatifcodetestIA

Résumé

Dans cette vidéo, le créateur de la chaîne Vision IA teste GPT-5 en le confrontant à sept autres IA (Gemini, Claude, Grok, Mistral, Kimi, DeepSeek, Qwen) sur huit défis techniques : énigme logique, jeu Mario, Minecraft, tableur, synthétiseur musical, éditeur de shaders, jeu de course 3D et planificateur de repas. Il montre les prompts et les résultats en direct, sans montage trompeur. Les résultats sont contrastés : GPT-5 excelle sur le jeu de course 3D et le synthétiseur, mais échoue sur le tableur et le planificateur de repas. L’auteur souligne l’instabilité de GPT-5, probablement due à un routeur qui oriente les requêtes vers différents modèles internes. Il compare avec les concurrents, notant que Claude est souvent plus fiable, Gemini bon en one-shot, et que les IA chinoises comme Kimi surprennent. La conclusion est que GPT-5 est décevant pour du code complexe, mais peut être excellent sur certains projets créatifs. Il recommande de choisir selon les besoins et de privilégier l’itération (vibe coding).

162 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur principale réside dans la démonstration pratique et factuelle : chaque test est montré avec le prompt exact et le résultat, ce qui permet au spectateur de juger par lui-même. L’argumentation est solide car elle s’appuie sur des exemples concrets et variés, couvrant différents aspects du développement (jeu, application, outil). L’auteur évite le parti pris en montrant aussi les réussites de GPT-5, ce qui renforce la crédibilité. Cependant, la méthodologie n’est pas parfaitement rigoureuse : pas de répétition des tests pour vérifier la reproductibilité, pas de contrôle des versions exactes des modèles, et certains tests sont subjectifs (qualité graphique). L’argument principal sur l’instabilité de GPT-5 est bien étayé par les résultats contrastés, mais il reste spéculatif sur la cause (routeur).

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : les tests sont reproductibles (prompts fournis), mais l’auteur ne cite aucune source externe, ni documentation officielle, ni études. Il se base uniquement sur son expérience. La qualité des sources est donc faible, mais l’honnêteté de la démarche (montrer les échecs) compense. L’adéquation titre/contenu est bonne : le titre annonce un test sceptique, et la vidéo confirme que GPT-5 déçoit sur plusieurs points. Les commentaires montrent que le public apprécie l’objectivité, mais certains regrettent le manque de tests sur des usages non-code.

223 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : un test critique de GPT-5, avec une conclusion sceptique.

Qualité & fiabilité

7/10

Test comparatif factuel avec prompts et résultats montrés, mais méthodologie non standardisée (pas de répétitions, pas de contrôle des versions) et absence de sources externes.

Moments clés

Sources citées

Sources concordantes

  • Commentaires de la vidéo — Plusieurs commentaires rapportent des expériences similaires de déception avec GPT-5.

Sources discordantes

  • Commentaires de la vidéo — Certains commentaires disent avoir une bonne expérience avec GPT-5, ce qui contraste avec les échecs montrés.

Apport & nouveautés

L’apport original est de fournir un test comparatif concret et transparent de GPT-5, en montrant les prompts et les résultats, ce qui est rare dans les revues d’actualité. La vidéo met en évidence l’instabilité de GPT-5, un point souvent débattu mais rarement démontré par des exemples aussi variés. Elle aide les utilisateurs à choisir le modèle selon leurs besoins, en montrant que GPT-5 n’est pas le meilleur partout.

Pour aller plus loin :

  • Routeur de modèles (LLM routing) — Concept clé pour comprendre l’instabilité de GPT-5.
  • Vibe coding — Pratique de développement itératif avec l’IA, mentionnée dans la vidéo.
  • Benchmark SWE-bench — Référence pour évaluer les capacités de codage des LLM.

111 mots

Profil radar

Le profil radar montre une bonne quantité d'information et une qualité correcte, mais une fiabilité moyenne et un niveau technique modéré. Cela reflète une vidéo riche en exemples mais manquant de rigueur méthodologique.

Fiabilité 6/10

💬 Équilibré. Sur les 30 commentaires analysés, le public est partagé : certains expriment leur déception vis-à-vis de GPT-5, d'autres apprécient l'objectivité du test, et quelques-uns demandent plus de tests sur des usages non-code.