BEST Local AI for Tool Calls? GPT-OSS, DeepSeek, Kimi K2, MiniMax, GLM Compared

BEST Local AI for Tool Calls? GPT-OSS, DeepSeek, Kimi K2, MiniMax, GLM Compared

Meilleure IA locale pour les appels d'outils ? GPT-OSS, DeepSeek, Kimi K2, MiniMax, GLM comparés

🎙 xCreate 👥 26K 📅 20 novembre 2025 ⏱ 24 min 👁 6K 📄 revue d'actualité 🧭 2026-09-09
Disponible en : Français (actuel) English

Mots-clés

tool callingopen sourcelocal AIGPT-OSSDeepSeekKimi K2MiniMaxGLMQwenInferencer

Résumé

Cette vidéo de la chaîne xCreate présente un test pratique de plusieurs modèles d’IA locales (GPT-OSS 20B/120B, DeepSeek-V3.1, Kimi K2 Thinking, MiniMax M2, GLM-4.6, Qwen3, Apertus) dans le cadre d’appels d’outils (tool calling). L’auteur utilise l’application Inferencer v1.7, qui fournit un environnement sandboxé et des fonctions personnalisables. Il démontre l’utilisation d’outils comme la météo et la recherche web (via DuckDuckGo) et souligne les différences entre les modèles en termes de capacité à gérer des URLs génériques, à contourner les limits de requêtes ou à exploiter le cache. Les tests montrent que GPT-OSS 120B et MiniMax M2 sont les plus performants pour adapter leurs stratégies, tandis que Kimi K2 et certains modèles plus petits échouent sans outil de recherche dédié. L’auteur explique également comment créer un nouvel outil de recherche en modifiant du code Python, en remplaçant DuckDuckGo par Serper, et insiste sur la flexibilité de la solution. Enfin, il compare les forces et faiblesses de chaque modèle, soulignant que les modèles récents gèrent bien les appels d’outils mais avec des formats différents, et invite les spectateurs à partager leurs préférences.

180 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur de ce contenu réside dans la démonstration concrète et comparative de l’utilisation d’appels d’outils par des modèles locaux populaires, avec des exemples pratiques et reproductibles. L’argumentation est solide car chaque test est illustré par des captures d’écran et des traces de fonctionnement, permettant de comprendre les décisions prises par les modèles. L’auteur ne se contente pas de simplement affirmer des résultats, il explique les mécanismes internes (comme l’utilisation du cache, la gestion des erreurs, l’adaptation des paramètres). Toutefois, certaines conclusions sont basées sur des cas isolés et pourraient être renforcées par des répétitions ou des tests plus formalisés. La démonstration de création d’un nouvel outil est également une valeur ajoutée pratique.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : les tests sont contingents (dépendent des caches, des erreurs du web) et manquent de protocole mesuré. Les sources sont essentiellement les modèles accessibles sur Hugging Face, dont les liens sont fournis dans la description, ainsi que l’application Inferencer. Le titre correspond bien au contenu, puisqu’il annonce une comparaison de plusieurs modèles pour les appels d’outils ; l’adéquation est bonne. Aucun commentaire n’était fourni, donc aucune analyse de tendances du public n’est possible.

206 mots

Adéquation titre / contenu

Le titre décrit fidèlement le contenu en mettant en avant une comparaison pratique de plusieurs modèles locaux pour les appels d'outils.

Qualité & fiabilité

7/10

Les tests reposent sur des exécutions réelles, mais sans protocole de contrôle ni répétitions, et certaines réussites dépendent de caches ou de recherches directes. Les sources sont principalement des modèles listés sur Hugging Face, mais l'évaluation reste subjective.

Moments clés

Sources citées

Références externes

Apport & nouveautés

Cette vidéo apporte une comparaison pratique et à jour de l’efficacité des appels d’outils pour plusieurs modèles locaux open-weight, mettant en lumière les différences de stratégie entre les modèles (utilisation de cache, changement de paramètres, adaptation à des erreurs réseau). Elle montre aussi la flexibilité de l’application Inferencer pour créer et modifier des outils, ce qui constitue une ressource utile pour les utilisateurs souhaitant intégrer des fonctions personnalisées à leurs modèles locaux.

Pour aller plus loin :

144 mots

Profil radar

Le profil radar montre des scores équilibrés autour de 7, indiquant un contenu informatif et technique correct, mais avec une fiabilité globale légèrement inférieure en raison du caractère unique des tests. La quantité et la qualité d'information sont bonnes, le niveau technique est adapté à un public déjà familiarisé.

Fiabilité 6/10