NVIDIA won't like this. I Ran Nemotron 3 ULTRA on a Mac 🤯 | RIP Claude?

NVIDIA won't like this. I Ran Nemotron 3 ULTRA on a Mac 🤯 | RIP Claude?

NVIDIA ne va pas aimer ça. J'ai fait tourner Nemotron 3 ULTRA sur un Mac 🤯 | RIP Claude ?

🎙 xCreate 👥 26K 📅 5 juin 2026 ⏱ 18 min 👁 10K 📄 revue d'actualité 🧭 2026-09-09
Disponible en : Français (actuel) English

Mots-clés

Nemotron 3 Ultraquantizationinférence localeMoEraisonnement

Résumé

Cette vidéo de la chaîne xCreate présente un test approfondi du modèle NVIDIA Nemotron 3 Ultra (550 milliards de paramètres) exécuté localement sur un Mac Studio équipé d’une puce M3 Ultra 512 Go. L’auteur commence par présenter les caractéristiques du modèle, notamment son nouveau license ouverte (open source) et la disponibilité publique de ses données d’entraînement. Il souligne les exigences matérielles élevées recommandées par NVIDIA (systèmes à plus de 250 000 dollars), mais démontre qu’il est possible de l’exécuter sur du matériel grand public grâce à des quantifications (versions compressées). Il teste trois variantes : une quantification 4.5-bit, une version 6.2 INF, et une conversion MLX communautaire, et les compare sur des exercices variés comme la reconnaissance de paroles de chansons, la génération de jeux (Flappy Bird en 2D et 3D), la création d’un clone de MS Word, des problèmes mathématiques de type olympiade, du code Python (jeu Snake) et un générateur de planètes procédural. Il mesure également les vitesses d’inférence (10 à 17 tokens par seconde) et la qualité des réponses selon le niveau de raisonnement (désactivé, moyen, élevé). Il compare ses résultats avec ceux d’autres modèles comme GLM 5.1, Kimi K2.6, DeepSeek et Qwen, et constate que Nemotron 3 Ultra est compétitif, mais que GLM le surpasse nettement en génération de code 3D fonctionnelle. L’auteur conclut que le modèle a un fort potentiel, surtout grâce à son ouverture et sa licence permissive, mais qu’il reste des améliorations à faire, notamment en matière de génération de jeux complexes.

249 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur informative de la vidéo est élevée pour une démonstration pratique : elle fournit des données chiffrées sur les performances d’inférence, des comparaisons directes avec plusieurs modèles de référence, et une évaluation nuancée des forces et faiblesses. L’argumentation est appuyée par des captures d’écran, des exemples concrets et des tests répétés avec différents réglages de raisonnement. L’auteur adopte une approche pragmatique, reconnaissant les limites de son test (temps long, erreurs de génération) tout en soulignant le potentiel du modèle. Cependant, certains choix restent subjectifs (notation des résultats) et les benchmarks ne sont pas standardisés. La démonstration que le modèle peut tourner sur un Mac avec des quantifications est originale et contrebalance les exigences matérielles officielles.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : les tests sont réalisés de manière artisanale mais transparente, avec une vérification de l’intégrité du code d’inférence via le cloud NVIDIA. L’auteur cite les sources directement (Hugging Face pour le modèle, inferencer.com pour l’application de test) et fournit des liens vers des vidéos compagnons sur d’autres modèles. L’adéquation du titre au contenu est globalement correcte, bien que la mention ‘RIP Claude’ soit trompeuse : Claude n’est jamais testé, et la comparaison se fait plutôt avec GLM et Kimi. Les sources utilisées sont principalement les modèles eux-mêmes et des outils open-source, ce qui renforce la crédibilité, mais le manque de protocole formel et de références académiques limite la portée scientifique.

246 mots

Adéquation titre / contenu

Le titre est accrocheur et légèrement exagéré, mais il reflète bien le contenu principal : le test de Nemotron 3 Ultra sur un Mac. La mention 'RIP Claude' est très peu abordée dans la vidéo, ce qui crée une légère dissonance, mais le corps de la vidéo reste concentré sur la comparaison avec d'autres modèles.

Qualité & fiabilité

8/10

Le test est méthodique et transparent, avec des comparaisons réelles sur différents quantifications et modes de raisonnement. L'auteur documente ses procédures et fournit des liens vers les ressources utilisées. Cependant, il s'agit d'une évaluation subjective sans protocole scientifique formalisé, et certains aspects (comme les benchmarks annoncés par NVIDIA) sont relayés sans vérification approfondie.

Moments clés

Sources citées

Sources concordantes

  • Comparaison GLM 5.1 (vidéo) — Cette vidéo montre que GLM réussit à générer un Flappy Bird 3D fonctionnel, contrairement à Nemotron, ce qui corrobore les observations de xCreate sur les performances de GLM.

Sources discordantes

  • Benchmarks officiels NVIDIA — NVIDIA revendique des performances comparables à celles de GLM et Kimi, mais les tests de xCreate montrent que Nemotron est nettement inférieur en génération de code 3D, ce qui contredit ces benchmarks.

Références externes

Apport & nouveautés

L’apport principal de cette vidéo est de démontrer qu’un modèle massif (550B paramètres) peut être exécuté localement sur un Mac grand public grâce à la quantification, offrant des performances utilisables (10-17 tokens par seconde). L’auteur fournit des données concrètes sur les vitesses, les qualités de génération et les différences entre quantifications, ce qui est précieux pour la communauté. Il met aussi en lumière la nouvelle licence ouverte de NVIDIA et la disponibilité des données d’entraînement, un point rare.

Pour aller plus loin :

147 mots

Profil radar

Le profil radar montre une forte quantité d'informations et une bonne qualité globale, mais une fiabilité et un niveau technique légèrement inférieurs. Cela reflète un contenu riche en données pratiques mais avec des méthodes non standardisées et un contenu technique accessible plutôt qu'expert.

Fiabilité 7/10