
Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 3: Architectures
Mots-clés
Résumé
160 mots
Évaluation critique
Ce cours magistral de Tatsunori Hashimoto, professeur à Stanford, offre une synthèse remarquablement claire et à jour des architectures de modèles de langage. La valeur pédagogique est élevée : l’enseignant adopte une approche historique et comparative, ce qui permet de comprendre non seulement les choix techniques mais aussi leur motivation. La rigueur scientifique est exemplaire : chaque affirmation est appuyée sur des références précises (papers, modèles) et les explications sont nuancées, reconnaissant les zones d’incertitude. La structure est logique : après un rappel du transformer original, il décline les variations (normalisation, activation, position) puis les hyperparamètres et enfin les astuces de stabilité. La qualité des sources est excellente : les modèles cités (LLaMA, Qwen, Gemma, etc.) sont des références du domaine, et les liens vers les ressources du cours sont fournis. L’adéquation titre/contenu est parfaite : le titre annonce une exploration des architectures, et c’est exactement ce qui est proposé. On peut toutefois regretter que certains points soient survolés, comme les détails de l’implémentation de RoPE ou les mécanismes précis de stabilité, mais cela est inhérent à un format de cours. La présence d’une séquence publicitaire pour les programmes en ligne de Stanford est brève et n’affecte pas la qualité du contenu. En résumé, ce cours est une référence pour quiconque souhaite comprendre les choix architecturaux des LLM modernes.
219 mots
Adéquation titre / contenu
Le titre est parfaitement adapté : il s'agit bien d'un cours sur les architectures des modèles de langage, avec une approche pratique et historique.
Qualité & fiabilité
9/10
Cours universitaire de niveau master par un professeur de Stanford, s'appuyant sur une revue systématique des architectures récentes (LLaMA, Qwen, Gemma, etc.) et des principes établis en apprentissage profond. Les sources sont citées et les explications sont rigoureuses, bien que le format magistral limite la profondeur sur certains points.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction : objectifs du cours, approche par revue des modèles existants.
- Rappel du transformer original et des choix standards (post-norm, ReLU, position sinusoidale).
- Présentation des variations modernes : pré-norm, RoPE, SwiGLU, etc.
- Analyse des tendances historiques : de l'expérimentation à la standardisation avec LLaMA 2.
- Explication détaillée de la pré-norm vs post-norm et de l'importance de la stabilité.
- Discussion sur les choix de normalisation (RMSNorm) et d'activation (SwiGLU).
- Présentation des hyperparamètres : dimension FFN, taille du vocabulaire, etc.
- Astuces de stabilité d'entraînement : warm-up, redimensionnement des gradients.
- Synthèse des tendances et des compromis architecturaux.
- Conclusion et recommandations pour la suite du cours.
Sources citées
- CS336 Course Website — Page officielle du cours avec syllabus et ressources.
- Stanford Online CS336 Course Page — Page d'inscription au cours en ligne.
- Stanford AI Programs — Présentation des programmes d'IA de Stanford.
- Course Playlist — Playlist des vidéos du cours.
Sources concordantes
- Attention Is All You Need — Article fondateur du transformer, cité implicitement pour les bases.
- LLaMA: Open and Efficient Foundation Language Models — Modèle de référence pour les choix architecturaux modernes.
Sources discordantes
- OPT-350M — Le professeur mentionne que ce modèle utilise encore la post-norm, contrairement à la tendance générale, ce qui constitue une exception notable.
Apport & nouveautés
Ce cours apporte une synthèse actualisée des choix architecturaux pour les modèles de langage, en les reliant à des principes fondamentaux comme la stabilité de l’entraînement et la propagation du gradient. Il met en évidence des tendances claires (pré-norm, RoPE, SwiGLU) et explique pourquoi elles sont devenues standards. L’approche comparative, s’appuyant sur de nombreux modèles récents, permet de dégager des invariants et des variations acceptables.
Pour aller plus loin :
- Attention Is All You Need — Article fondateur du transformer, indispensable pour comprendre les bases.
- RoFormer: Enhanced Transformer with Rotary Position Embedding — Article original sur RoPE, utilisé dans la plupart des LLM modernes.
- SwiGLU: GLU Variants Improve Transformer — Article présentant les variantes GLU, dont SwiGLU, adoptées par LLaMA et autres.
- RMSNorm — Normalisation utilisée dans LLaMA, alternative à LayerNorm.
- LLaMA: Open and Efficient Foundation Language Models — Article de référence pour l’architecture LLaMA, qui a influencé de nombreux modèles.
151 mots
Profil radar
Le profil radar montre une très bonne couverture sur tous les axes, avec une légère prédominance de la quantité et de la qualité de l'information, reflétant un cours dense et bien documenté. Le niveau technique est élevé mais accessible, et la fiabilité est excellente grâce aux références académiques.
💬 Sur les 0 commentaires analysés, aucune tendance n'est disponible.