Does Step 3.7 Flash Actually Beat DeepSeek & Claude? 🫣 200K TOKENS+

Does Step 3.7 Flash Actually Beat DeepSeek & Claude? 🫣 200K TOKENS+

Step 3.7 Flash a-t-il réellement battu DeepSeek et Claude ? 🫣 Plus de 200 000 jetons

🎙 xCreate 👥 26K 📅 31 mai 2026 ⏱ 17 min 👁 7K 📄 reportage 🧭 2026-09-09
Disponible en : Français (actuel) English

Mots-clés

StepFunmodèle de langagetest pratiquelong contexteIA générative

Résumé

Cette vidéo de la chaîne xCreate présente un test pratique du modèle Step 3.7 Flash de StepFun AI, exécuté localement sur une machine M3 Ultra. Le créateur évalue le modèle sur plusieurs défis : génération de jeux (Flappy Bird 3D), clonage de TiddlyWiki, réponses à des questions simples, création d’images SVG, résolution d’un problème d’olympiade de mathématiques, et test avec le harnais OpenClaw. Les résultats montrent des performances mitigées : le modèle excelle dans la génération d’images et de wikis, mais échoue sur un problème mathématique avancé, même après avoir généré près de 200 000 tokens en 3h30. Le modèle est également testé avec différents niveaux de raisonnement (off, low, medium, high), montrant une augmentation significative des tokens. La vidéo inclut des comparaisons avec les statistiques officielles du Claw Eval, où Step 3.7 Flash se classe très bien, presque au niveau de Claude Opus. Le créateur souligne la nécessité de configurer correctement l’inférence et note des erreurs d’exécution selon les tâches. L’ensemble donne un aperçu concret des capacités et limites du modèle, tout en mettant en avant les aspects pratiques de l’inférence locale.

183 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur empirique en testant le modèle dans des scénarios concrets, avec des mesures de vitesse (tokens par seconde) et des comptes rendus de succès ou d’échecs. L’argumentation est basée sur des exemples détaillés, mais elle reste subjective et dépendante du matériel utilisé. Le créateur ne fournit pas de méthodologie strictement scientifique (pas de répétition, pas de contrôle des variables), mais il offre une perspective utile pour les utilisateurs potentiels. La démonstration de l’échec en mathématiques, malgré une génération massive de tokens, est un point fort qui nuance les annonces marketing.

Rigueur scientifique, qualité des sources, adéquation du titre

Les sources citées dans la description incluent le lien Hugging Face pour le modèle, l’application Inferencer, et des vidéos compagnes. Aucune source externe n’est utilisée pour valider les résultats. La rigueur scientifique est limitée : les tests sont anecdotiques et non reproductibles, mais le créateur est transparent sur ses conditions (quantization, matériel). Le titre est accrocheur mais ne reflète pas une comparaison directe ; il oriente vers une évaluation de performance. L’adéquation titre/contenu est partielle, car le contenu est plus un test personnel qu’une étude comparative rigoureuse.

196 mots

Adéquation titre / contenu

Le titre promet une comparaison avec DeepSeek et Claude, mais la vidéo se concentre sur des tests pratiques sans comparaison directe, bien qu'elle mentionne les statistiques du Claw Eval où le modèle se positionne favorablement.

Qualité & fiabilité

7/10

La vidéo fournit des tests concrets et des mesures détaillées (tokens, vitesses), mais ils restent ponctuels, non reproductibles, et certains résultats sont contradictoires (échec en mathématiques, succès en génération d'images).

Moments clés

Sources citées

Références externes

Apport & nouveautés

Cette vidéo apporte un retour d’expérience concret sur l’utilisation locale de Step 3.7 Flash, en particulier ses performances sur des tâches de codage et de génération. Elle met en évidence des points forts (génération d’images SVG, clonage de wiki) et des faiblesses (échec en mathématiques malgré un long contexte). L’originalité réside dans la démonstration de l’inférence sur un matériel spécifique (M3 Ultra) et la comparaison des niveaux de raisonnement.

Pour aller plus loin :

123 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique élevé, mais la fiabilité globale est modérée en raison de tests ponctuels et de résultats contradictoires. La qualité de l'information est correcte mais non exhaustive.

Fiabilité 6/10