Big Llm architecture comparison - part 2

Big Llm architecture comparison - part 2

🎙 West Coast Machine Learning 👥 3K 📅 8 octobre 2025 ⏱ 82 min 👁 88 📄 revue de littérature 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

Kimi2GPT-OSSGrok-2.5GLM 4.5Qwen-3

Résumé

Cette vidéo est la deuxième partie d’une discussion de groupe sur l’article de Sebastian Raschka ‘The Big LLM Architecture Comparison’. Les participants analysent en détail les architectures de plusieurs grands modèles de langage récents. Ils commencent par Kimi2, notant son passage à l’optimiseur Muon et son architecture très similaire à DeepSeek-V3, avec un grand nombre d’experts. Ensuite, ils examinent GPT-OSS, un modèle open-weight d’OpenAI, et discutent de son mécanisme d’attention bias pour gérer les tokens de début de séquence, une alternative aux tokens spéciaux. Ils comparent la largeur et la profondeur des modèles, notant que GPT-OSS est plus large mais moins profond que Qwen. Grok-2.5 est présenté comme un modèle assez standard avec un expert dense supplémentaire. GLM 4.5 est un modèle hybride instruction/raisonnement, avec des performances proches de modèles propriétaires. Enfin, Qwen-3 est discuté, avec son architecture similaire à DeepSeek mais sans expert partagé. La discussion se termine par un débat ouvert sur les tendances architecturales, notamment l’importance de l’optimiseur Muon et la question de la collocation des experts pour l’inférence.

172 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public technique : les intervenants analysent des détails architecturaux précis (nombre d’experts, dimensions, optimiseurs) et les comparent entre modèles. L’argumentation est solide, basée sur des lectures des articles et des raisonnements logiques, mais certaines affirmations restent spéculatives (par exemple, les motivations d’OpenAI pour GPT-OSS). La discussion est enrichie par des échanges critiques, comme sur l’attention bias de GPT-OSS.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les intervenants s’appuient sur l’article de Sebastian Raschka et mentionnent les sources primaires (papers). Cependant, la discussion est informelle et certaines références ne sont pas citées explicitement. Le titre est adéquat, bien que la vidéo soit une discussion de groupe plutôt qu’une présentation structurée. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

146 mots

Adéquation titre / contenu

Le titre est clair et correspond au contenu : une comparaison d'architectures de LLM, deuxième partie.

Qualité & fiabilité

7/10

Discussion technique approfondie basée sur l'article de Sebastian Raschka, avec analyse critique des architectures de modèles. Les intervenants sont des praticiens expérimentés, mais la discussion est informelle et certaines affirmations restent spéculatives.

Chapitres

Sources citées

Sources concordantes

Références externes

Apport & nouveautés

La vidéo apporte une analyse comparative détaillée des architectures de LLM récents, en mettant en lumière des points souvent négligés comme l’optimiseur Muon, l’attention bias de GPT-OSS, et les différences subtiles entre modèles. La discussion souligne l’influence de DeepSeek-V3 comme blueprint dominant.

Pour aller plus loin :

  • Muon Optimizer — Note de pertinence : l’optimiseur Muon est central dans Kimi2, cette référence explique son fonctionnement.
  • DeepSeek-V3 Technical Report — Note de pertinence : source de l’architecture de base de nombreux modèles discutés.
  • Attention Sinks — Note de pertinence : concept lié à la gestion des tokens de début de séquence, pertinent pour GPT-OSS.

103 mots

Profil radar

Le profil radar montre une forte quantité d'informations et un niveau technique élevé, mais une fiabilité globale légèrement inférieure en raison du caractère informel de la discussion. La qualité de l'information est bonne, mais certaines affirmations restent spéculatives.

Fiabilité 7/10