Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 3: Architectures

Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 3: Architectures

🎙 Tatsunori Hashimoto 👥 1.2M 📅 15 avril 2026 ⏱ 89 min 👁 44K 📄 cours magistral 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

transformerpre-normRoPESwiGLUstabilité

Résumé

Ce cours de Stanford, donné par Tatsunori Hashimoto, propose une analyse approfondie des architectures des modèles de langage modernes. Après une introduction soulignant la complexité des choix architecturaux, le professeur passe en revue les principales variations par rapport au transformer original de Vaswani et al. Il explique notamment le passage de la post-norm à la pré-norm, justifié par une meilleure stabilité et une propagation du gradient plus efficace. Il détaille ensuite les choix de normalisation (RMSNorm), d’activation (SwiGLU) et d’encodage positionnel (RoPE), en s’appuyant sur des exemples concrets comme LLaMA, Qwen, Gemma. La deuxième partie du cours aborde les hyperparamètres (dimension du FFN, taille du vocabulaire, etc.) et les astuces de stabilité d’entraînement, comme le warm-up ou le redimensionnement des gradients. L’accent est mis sur l’importance de l’expérimentation et sur l’évolution des architectures vers une meilleure gestion du contexte long. Le cours se conclut sur une synthèse des tendances et des compromis à considérer lors de la conception d’un modèle.

160 mots

Évaluation critique

Ce cours magistral de Tatsunori Hashimoto, professeur à Stanford, offre une synthèse remarquablement claire et à jour des architectures de modèles de langage. La valeur pédagogique est élevée : l’enseignant adopte une approche historique et comparative, ce qui permet de comprendre non seulement les choix techniques mais aussi leur motivation. La rigueur scientifique est exemplaire : chaque affirmation est appuyée sur des références précises (papers, modèles) et les explications sont nuancées, reconnaissant les zones d’incertitude. La structure est logique : après un rappel du transformer original, il décline les variations (normalisation, activation, position) puis les hyperparamètres et enfin les astuces de stabilité. La qualité des sources est excellente : les modèles cités (LLaMA, Qwen, Gemma, etc.) sont des références du domaine, et les liens vers les ressources du cours sont fournis. L’adéquation titre/contenu est parfaite : le titre annonce une exploration des architectures, et c’est exactement ce qui est proposé. On peut toutefois regretter que certains points soient survolés, comme les détails de l’implémentation de RoPE ou les mécanismes précis de stabilité, mais cela est inhérent à un format de cours. La présence d’une séquence publicitaire pour les programmes en ligne de Stanford est brève et n’affecte pas la qualité du contenu. En résumé, ce cours est une référence pour quiconque souhaite comprendre les choix architecturaux des LLM modernes.

219 mots

Adéquation titre / contenu

Le titre est parfaitement adapté : il s'agit bien d'un cours sur les architectures des modèles de langage, avec une approche pratique et historique.

Qualité & fiabilité

9/10

Cours universitaire de niveau master par un professeur de Stanford, s'appuyant sur une revue systématique des architectures récentes (LLaMA, Qwen, Gemma, etc.) et des principes établis en apprentissage profond. Les sources sont citées et les explications sont rigoureuses, bien que le format magistral limite la profondeur sur certains points.

Moments clés

Sources citées

Sources concordantes

Sources discordantes

  • OPT-350M — Le professeur mentionne que ce modèle utilise encore la post-norm, contrairement à la tendance générale, ce qui constitue une exception notable.

Apport & nouveautés

Ce cours apporte une synthèse actualisée des choix architecturaux pour les modèles de langage, en les reliant à des principes fondamentaux comme la stabilité de l’entraînement et la propagation du gradient. Il met en évidence des tendances claires (pré-norm, RoPE, SwiGLU) et explique pourquoi elles sont devenues standards. L’approche comparative, s’appuyant sur de nombreux modèles récents, permet de dégager des invariants et des variations acceptables.

Pour aller plus loin :

151 mots

Profil radar

Le profil radar montre une très bonne couverture sur tous les axes, avec une légère prédominance de la quantité et de la qualité de l'information, reflétant un cours dense et bien documenté. Le niveau technique est élevé mais accessible, et la fiabilité est excellente grâce aux références académiques.

Fiabilité 9/10

💬 Sur les 0 commentaires analysés, aucune tendance n'est disponible.