Let's Run the New #1 Local AI by China's LARGEST Company 🤯 | Hy3 TESTED

Let's Run the New #1 Local AI by China's LARGEST Company 🤯 | Hy3 TESTED

Testons la nouvelle IA locale n°1 de la plus grande entreprise chinoise 🤯 | Testée avec Hy3

🎙 xCreate 👥 26K 📅 6 mai 2026 ⏱ 25 min 👁 9K 📄 revue d'actualité 🧭 2026-09-09
Disponible en : Français (actuel) English

Mots-clés

Hy3 previewQwen 27Bquantificationmixture-of-expertsraisonnement

Résumé

Cette vidéo de la chaîne xCreate présente un test pratique du modèle Hy3 Preview, un LLM de 295 milliards de paramètres (21 milliards actifs) développé par Tencent, la plus grande entreprise chinoise en termes de revenus. Le créateur exécute le modèle localement sur un Mac Studio M3 Ultra avec 512 Go de RAM, utilisant une quantification 9-bit, et compare les performances avec la version cloud (BF16) ainsi qu’avec le modèle Qwen 27B d’Alibaba, un concurrent direct. Les tests comprennent une question d’olympiade de mathématiques, la génération de code (système solaire 3D, Flappy Bird, simulation de ville), des tests de logique (problème du tramway, lavage de voiture) et des tâches d’agent (recherche web sur Wikipedia). Les résultats montrent que Hy3, avec le raisonnement activé, produit des réponses détaillées et obtient de bons résultats sur les tâches de codage, mais que Qwen 27B, bien que 10 fois plus petit, offre des résultats comparables et parfois plus aboutis sur des prompts spécifiques. La vidéo souligne l’importance du niveau de raisonnement (faible, élevé, désactivé) qui modifie la qualité et la longueur des réponses. Elle met en évidence un cas d’usage où Hy3 se distingue : le respect strict des instructions pour la recherche documentaire, allant jusqu’à télécharger le contenu complet d’un article alors que Qwen se contente des résumés. Le créateur conclut que Hy3 est prometteur, mais qu’il reste en version préview et que des tests supplémentaires sont nécessaires pour confirmer ses avantages.

239 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur pratique en montrant concrètement comment un modèle local de grande taille (295B) se comporte face à un modèle plus petit (27B) sur des tâches variées. L’argumentation est basée sur des exécutions réelles, avec des captures d’écran et des comparaisons directes, ce qui donne un aperçu factuel des capacités des modèles. Cependant, la méthodologie est peu rigoureuse : les tests ne sont pas standardisés, les conditions d’exécution (température, graines aléatoires) ne sont pas entièrement contrôlées, et certaines conclusions reposent sur des observations subjectives (qualité visuelle). Le créateur reconnaît des limites, comme le fait que la version cloud a échoué sur certains tests, ce qui montre une certaine honnêteté. La démonstration de l’influence du niveau de raisonnement est intéressante, mais les paramètres exacts ne sont pas détaillés. Globalement, la valeur informationnelle est bonne pour un public technique intéressé par les LLM locaux, mais l’argumentation gagnerait en robustesse avec des benchmarks standardisés et récurrents.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est limitée : les tests sont réalisés de manière artisanale, sans protocole défini ni comparaison quantitative systématique. Les sources citées incluent la page du modèle sur Hugging Face (https://huggingface.co/inferencerlabs/Hy3-preview-MLX-9bit ) et le site de l’application Inferencer (https://inferencer.com ), ainsi que des vidéos compagnons sur des modèles concurrents. Les résultats sont présentés avec des métriques de performance (tokens/seconde, mémoire utilisée) mais sans analyse statistique. Le titre est fidèle au contenu : la vidéo teste bien Hy3 localement et le compare à Qwen. Aucune source discordante n’est mentionnée, mais les limites de la version preview sont soulignées. La chaîne a une orientation technique, mais le manque de détails méthodologiques limite la reproductibilité. Aucun commentaire spectateur n’a été fourni pour analyse, donc la tendance du public n’est pas évaluée.

300 mots

Adéquation titre / contenu

Le titre annonce clairement le test local du modèle Hy3 de Tencent, et la vidéo exécute effectivement ce test sur une machine locale (Mac Studio) en comparant avec la version cloud et avec Qwen 27B. L'adéquation est bonne.

Qualité & fiabilité

6/10

La vidéo présente des tests pratiques de comparaison (Hy3 vs Qwen 27B) avec des exécutions locales et cloud, mais sans protocole rigoureux ni reproductibilité détaillée. Les performances sont rapportées de manière informelle, et quelques résultats sont contradictoires ou non concluants. Le niveau de fiabilité est moyen, conforme à une revue d'actualité technique de type influenceur.

Moments clés

Sources citées

  • Hy3-preview-MLX-9bit sur Hugging Face — Modèle quantifié 9-bit utilisé pour les tests locaux sur Mac Studio.
  • Inferencer App — Application d'inférence utilisée pour exécuter le modèle et gérer les sessions.
  • Vidéo compagnon : Kimi K2.6 — Test d'un autre modèle local (Kimi K2.6) pour comparaison.
  • Vidéo compagnon : GLM 5.1 — Test d'un autre modèle (GLM 5.1) cité pour comparaison.
  • Vidéo compagnon : Expert Controls — Explication des contrôles d'inférence avancés.
  • Mac Studio (lien produit) — Matériel utilisé pour exécuter le modèle (lien d'affiliation).
  • MacBook Pro (lien produit) — Matériel utilisé pour exécuter Qwen 27B (lien d'affiliation).
  • LG C2 42" Monitor (lien produit) — Écran utilisé pour la démonstration (lien d'affiliation).
  • QNAP NAS Drive (lien produit) — Stockage réseau mentionné (lien d'affiliation).

Sources concordantes

  • Hy3-preview-MLX-9bit sur Hugging Face — La page indique les caractéristiques techniques du modèle et sa quantification, cohérentes avec les affirmations de la vidéo.
  • Inferencer App — L'outil utilisé pour l'inférence ; la vidéo mentionne des paramètres comme la température à zéro.

Sources discordantes

  • Comparaison avec Qwen 27B (non indépendante) — La vidéo compare Hy3 à Qwen 27B, mais les conditions d'exécution ne sont pas identiques (matériel différent, quantifications différentes, versions non précisées). Cette disparité limite la validité de la comparaison directe.

Apport & nouveautés

La vidéo offre un retour pratique sur un modèle LLM très récent (Hy3 Preview) qui n’avait pas encore été testé en profondeur publiquement. Elle montre l’impact du paramètre de raisonnement (faible, élevé) sur la qualité des réponses, ainsi que la faisabilité d’exécuter un modèle de 295B en local avec une quantification 9-bit. Elle met en lumière un avantage spécifique de Hy3 : une meilleure observance des instructions complexes lors de tâches de recherche autonome, comparé à Qwen 27B. Ce test constitue une première exploration, mais des benchmarks standardisés et une comparaison avec d’autres modèles (DeepSeek, Kimi, GLM) manquent pour généraliser ces observations.

Pour aller plus loin :

175 mots

Profil radar

Le profil radar montre une quantité d'information élevée (8) et un niveau technique élevé (8), indiquant une vidéo dense et pointue. La qualité de l'information et la fiabilité globale sont moyennes (6 chacune), ce qui reflète une approche pratique mais peu rigoureuse. Le score global de 4/5 semble cohérent avec une vidéo utile mais perfectible d'un point de vue méthodologique.

Fiabilité 6/10