Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 1: Overview, Tokenization

Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 1: Overview, Tokenization

🎙 Percy Liang, Tatsunori Hashimoto, Marcel, Herman, Steven 👥 1.2M 📅 14 avril 2026 ⏱ 79 min 👁 140K 📄 cours magistral 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

Language ModelingTokenizationTransformerScaling LawsEfficiency

Résumé

Ce premier cours de la série CS336 de Stanford, intitulé ‘Language Modeling from Scratch’, présente les objectifs et la philosophie de la formation. Les instructeurs, Percy Liang et Tatsunori Hashimoto, introduisent l’importance de construire des modèles de langage à partir de zéro pour comprendre leur fonctionnement interne. Ils discutent des limites des modèles de pointe, souvent trop coûteux et opaques, et justifient l’approche ‘from scratch’ pour acquérir des compétences transférables. Le cours aborde les différences entre les modèles à petite et grande échelle, notamment en termes de répartition des calculs et de comportements émergents. Les instructeurs insistent sur l’importance de l’efficacité algorithmique, illustrée par les gains de 44x sur ImageNet entre 2012 et 2019. Ils présentent également un historique des modèles de langage, des n-grammes aux transformers, en passant par les réseaux de neurones et l’attention. La deuxième partie de la vidéo se concentre sur la tokenisation, expliquant les algorithmes BPE et Unigram, leurs avantages et inconvénients, et leur rôle dans la modélisation du langage. Le cours se termine par une introduction aux aspects pratiques, comme le calcul de l’entropie et la perplexité, et annonce les prochaines étapes du programme.

190 mots

Évaluation critique

Cette vidéo constitue une introduction solide et bien structurée au cours CS336. La valeur principale réside dans la clarté de l’exposé et la crédibilité des intervenants, tous chercheurs reconnus en traitement du langage naturel. L’argumentation en faveur de l’approche ‘from scratch’ est convaincante : elle permet de comprendre les mécanismes sous-jacents et de développer des compétences transférables à plus grande échelle. Les exemples concrets, comme la répartition des flops entre les couches MLP et attention, illustrent bien les différences entre petites et grandes échelles. La référence à la ‘Bitter Lesson’ est bien contextualisée, corrigeant une interprétation erronée courante. La partie historique est concise mais pertinente, reliant les développements clés des années 1990 à aujourd’hui. La section sur la tokenisation est technique et précise, expliquant les algorithmes BPE et Unigram avec des exemples. Cependant, certains points pourraient être approfondis, comme les détails mathématiques de la tokenisation ou les implications pratiques des choix de tokenisation. De plus, l’affirmation sur le coût de formation de GPT-4 (100 millions de dollars) est présentée comme spéculative, ce qui est honnête. La qualité des sources est bonne, avec des références à des travaux fondateurs comme ceux de Bengio, Vaswani et Kaplan. L’adéquation entre le titre et le contenu est parfaite. Dans l’ensemble, cette vidéo est une excellente introduction pour quiconque souhaite comprendre la modélisation du langage en profondeur.

222 mots

Adéquation titre / contenu

Le titre est clair et correspond parfaitement au contenu : présentation du cours et introduction à la tokenisation.

Qualité & fiabilité

8/10

Cours universitaire de Stanford, enseigné par des chercheurs reconnus, avec une approche pédagogique rigoureuse et des références à des travaux fondateurs. Les informations sont fiables et à jour, mais certaines affirmations (coûts de formation) sont spéculatives.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Cette vidéo apporte une introduction complète et pédagogique à la modélisation du langage, en mettant l’accent sur la construction ‘from scratch’. Elle offre une perspective unique sur les différences entre les modèles à petite et grande échelle, et insiste sur l’importance de l’efficacité algorithmique. La partie sur la tokenisation est particulièrement détaillée, expliquant les algorithmes BPE et Unigram avec des exemples concrets.

Pour aller plus loin :

109 mots

Profil radar

Le profil radar montre une excellente qualité d'information et une fiabilité élevée, avec une quantité d'information substantielle. Le niveau technique est élevé, ce qui reflète la nature avancée du cours. La fiabilité globale est renforcée par la crédibilité des intervenants et la rigueur académique.

Fiabilité 8/10