Normalement, ChatGPT ne devrait pas pouvoir faire ça

Normalement, ChatGPT ne devrait pas pouvoir faire ça

🎙 Underscore_ 👥 951K 📅 13 février 2026 ⏱ 32 min 👁 318K 📄 reportage 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

scrapinganti-botproxiesChatGPTdétection de bots

Résumé

La vidéo explore les coulisses du scraping web et des systèmes anti-bot, en expliquant comment des entreprises comme OpenAI parviennent à contourner ces protections pour entraîner leurs IA. L’invité, Fabien, expert en scraping, présente des démonstrations pratiques de contournement, notamment l’utilisation de proxies résidentiels et de techniques avancées pour imiter le comportement humain. Le sujet aborde la guerre de la donnée entre scrapers et anti-bots, les enjeux économiques (comparateurs de prix, veille concurrentielle) et les méthodes de détection (analyse comportementale, empreintes numériques). La vidéo souligne également les implications légales et éthiques, ainsi que l’importance des données pour l’entraînement des IA. Une séquence publicitaire pour Mammouth AI est présente au début. Le ton est pédagogique et accessible, avec des exemples concrets.

120 mots

Évaluation critique

La vidéo offre un aperçu fascinant et détaillé du monde du scraping et des anti-bots, un sujet rarement traité avec autant de clarté. L’expert invité, Fabien, démontre une maîtrise technique impressionnante et explique des concepts complexes de manière accessible. Les démonstrations en direct renforcent la crédibilité du contenu et permettent de visualiser concrètement les techniques évoquées. La structure narrative est bien construite, passant des bases du scraping aux méthodes de contournement avancées, puis aux implications plus larges pour l’IA et la société. Cependant, certains points mériteraient d’être nuancés : la vidéo présente le scraping comme une pratique courante et presque banale, sans toujours insister sur les aspects légaux et éthiques, bien que ceux-ci soient mentionnés. De plus, l’affirmation selon laquelle ChatGPT utilise des techniques de scraping sophistiquées est plausible mais non vérifiée directement ; elle repose sur des suppositions et des témoignages. La collaboration commerciale avec Mammouth AI est clairement signalée, ce qui est un point positif pour la transparence. Enfin, l’adéquation entre le titre et le contenu est bonne, même si le titre est un peu racoleur. Dans l’ensemble, la vidéo est de grande qualité, informative et divertissante, avec une rigueur scientifique correcte, même si elle ne prétend pas être une étude académique. Les sources citées sont principalement des liens vers des outils et des articles, mais elles sont pertinentes. La vidéo aurait pu bénéficier d’une analyse plus approfondie des implications juridiques et des risques de sécurité, mais elle reste une excellente introduction au sujet.

246 mots

Adéquation titre / contenu

Le titre est accrocheur et reflète le sujet principal : les techniques de scraping qui permettent à ChatGPT d'accéder à des sites protégés. Il est un peu racoleur mais reste pertinent.

Qualité & fiabilité

8/10

Le contenu est présenté par un expert en scraping et anti-bot, avec des démonstrations pratiques. Les explications techniques sont précises et illustrées. La vidéo mentionne des sources et des cas réels, mais certaines affirmations générales (comme l'utilisation de Smart TV pour des proxies) ne sont pas sourcées directement. La collaboration commerciale avec Mammouth AI est clairement signalée.

Moments clés

Sources citées

Sources concordantes

  • Common Crawl — Mentionné dans les commentaires comme source de données pour l'entraînement d'IA.

Références externes

Apport & nouveautés

La vidéo apporte un éclairage original sur les techniques de scraping et d’anti-bot, souvent méconnues du grand public. Elle met en lumière les stratégies utilisées par les entreprises pour collecter des données à grande échelle, et les contre-mesures déployées par les sites web. L’accent mis sur l’utilisation de proxies résidentiels via des appareils IoT (comme les Smart TV) est particulièrement instructif et peu documenté ailleurs. La démonstration pratique renforce l’aspect pédagogique.

Pour aller plus loin :

  • Scraping web - Wikipédia — Pour une définition et un historique du scraping.
  • Anti-bot - Cloudflare — Explication des technologies anti-bot et de leur fonctionnement.
  • RGPD - CNIL — Pour comprendre le cadre légal de la collecte de données en Europe.
  • Common Crawl — Organisation qui fournit des données web ouvertes, souvent utilisées pour l’entraînement d’IA.

132 mots

Profil radar

Le profil radar montre une vidéo très riche en informations (quantité élevée) et avec un bon niveau technique, mais la fiabilité est légèrement inférieure en raison de l'absence de sources formelles pour certaines affirmations. La qualité de l'information est bonne, mais la note globale reste élevée grâce à la clarté et à la démonstration pratique.

Fiabilité 8/10

💬 Très positif : les commentaires saluent la qualité pédagogique et la fascination pour les techniques présentées, avec quelques interrogations sur les aspects légaux et éthiques.