Let's Run DeepSeek V4 Flash vs Pro - Local AI Coding, Maths & Logic TESTED 🧐

Let's Run DeepSeek V4 Flash vs Pro - Local AI Coding, Maths & Logic TESTED 🧐

ExĂ©cutons DeepSeek V4 Flash vs Pro - Codage IA local, Maths et Logique TESTÉS 🧐

🎙 xCreate đŸ‘„ 26K 📅 27 avril 2026 ⏱ 22 min 👁 39K 📄 Ă©tude originale 🧭 2026-09-09
Disponible en : Français (actuel) English

Mots-clés

DeepSeek V4quantizationMLXcode generationmath reasoning

Résumé

La vidĂ©o prĂ©sente un test pratique du modĂšle DeepSeek V4, en comparant la version Flash (exĂ©cutĂ©e localement sur un Mac Studio M3 Ultra 512 Go) Ă  la version Pro (accessible sur le cloud via DeepSeek). Deux quantizations locales (Q9 et une version reconditionnĂ©e Q4) sont Ă©valuĂ©es sur des tĂąches de codage (systĂšme solaire 3D, Flappy Bird, Minecraft), des Ă©nigmes logiques, de l’Ă©criture crĂ©ative et un problĂšme de mathĂ©matiques de type IMO. Les rĂ©sultats montrent que la version Flash locale, avec environ 145 Go de mĂ©moire, rĂ©sout le problĂšme mathĂ©matique que des modĂšles plus volumineux (Kimi K2.6, GLM 5.1) n’avaient pas rĂ©ussi avec des quantifications plus Ă©levĂ©es. Le crĂ©ateur compare Ă©galement la qualitĂ© visuelle des gĂ©nĂ©rations, souligne les diffĂ©rences de mĂ©moire et de vitesse, et mentionne que le modĂšle est encore expĂ©rimental, avec des difficultĂ©s d’implĂ©mentation dans les moteurs d’infĂ©rence. Il annonce la publication d’une version expĂ©rimentale sur Hugging Face et l’intĂ©gration prochaine dans l’application Inferencer.

155 mots

Évaluation critique

Valeur des informations & soliditĂ© de l’argumentation

La valeur de l’information rĂ©side dans le test concret et reproductible en partie, avec des mĂ©triques de performance prĂ©cises (tokens/s, mĂ©moire utilisĂ©e) et une comparaison entre plusieurs configurations. L’argumentation est solide pour les aspects mesurables, mais la partie visuelle repose sur une apprĂ©ciation subjective, sans double aveugle ni critĂšres objectifs. Les Ă©checs sont honnĂȘtement rapportĂ©s, ce qui renforce la crĂ©dibilitĂ©. Toutefois, l’absence de contrĂŽle strict des variables (tempĂ©rature, seed) limite la robustesse des conclusions.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : le test est empirique mais non contrĂŽlĂ©, et les sources principales sont des rĂ©fĂ©rences Ă  la page Hugging Face du modĂšle et Ă  l’application Inferencer. Aucune source acadĂ©mique n’est citĂ©e. Le titre correspond exactement au contenu, et la description fournit des liens vers les ressources utilisĂ©es. L’analyse des commentaires (non fournis ici) ne peut ĂȘtre rĂ©alisĂ©e, mais les chiffres de likes et vues indiquent un intĂ©rĂȘt certain.

162 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : la vidéo compare effectivement les versions Flash et Pro, testant codage, maths et logique, en local et sur le cloud.

Qualité & fiabilité

7/10

Le test est concret, avec des mesures de performance (tokens/s, mémoire) et une comparaison de plusieurs quantizations. Cependant, l'évaluation visuelle est subjective, certains tests échouent, et les conditions ne sont pas strictement contrÎlées (température, seed).

Moments clés

Sources citées

  • DeepSeek-V4-Flash-MLX-9bit — ModĂšle utilisĂ© pour les tests locaux, version expĂ©rimentale.
  • Inferencer App — Application utilisĂ©e pour exĂ©cuter le modĂšle localement.
  • LG C2 42" Monitor — Moniteur utilisĂ© dans le setup (lien affiliĂ©).
  • Mac Studio — Machine de test (Mac Studio M3 Ultra 512 Go) (lien affiliĂ©).
  • MacBook Pro — Machine alternative Ă©voquĂ©e (lien affiliĂ©).
  • QNAP NAS Drive — Stockage potentiel pour modĂšles (lien affiliĂ©).
  • Kimi K2.6 — VidĂ©o compagnon sur Kimi K2.6.
  • GLM 5.1 — VidĂ©o compagnon sur GLM 5.1.
  • Expert Controls — VidĂ©o compagnon sur les contrĂŽles experts.

Apport & nouveautés

La vidĂ©o apporte un retour d’expĂ©rience pratique sur l’exĂ©cution locale d’un modĂšle de trĂšs grande taille (1,6 T de paramĂštres pour la version Pro), en testant une version Flash optimisĂ©e. Elle montre qu’une quantification adaptĂ©e permet de faire fonctionner un modĂšle performant avec environ 145 Go de mĂ©moire, rĂ©solvant un problĂšme mathĂ©matique difficile, ce qui n’avait pas Ă©tĂ© rĂ©ussi par des modĂšles plus volumineux dans des tests prĂ©cĂ©dents. Elle discute Ă©galement des compromis entre diffĂ©rentes stratĂ©gies de quantification (reconditionnement vs dĂ©quantification) et de l’importance du seed et de la tempĂ©rature pour la gĂ©nĂ©ration de code.

Pour aller plus loin :

  • Mixture of experts — Architecture de modĂšle utilisĂ©e par DeepSeek et d’autres, permettant d’activer parcimonieusement les paramĂštres.
  • Quantization (signal processing) — Concept gĂ©nĂ©ral de rĂ©duction de prĂ©cision numĂ©rique, appliquĂ© ici aux poids du modĂšle.
  • MLX (GitHub) — Framework d’apprentissage automatique optimisĂ© pour les puces Apple, utilisĂ© pour l’infĂ©rence locale sur Mac.

151 mots

Profil radar

Le profil radar indique un niveau technique élevé (7/10), une quantité d'information importante (8/10), une qualité d'information moyenne (6/10) due à la subjectivité visuelle, et une fiabilité globale moyenne (6/10) en raison des conditions de test non contrÎlées.

Fiabilité 6/10