Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 2 - Transformer-Based Models & Tricks

Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 2 - Transformer-Based Models & Tricks

🎙 Afshine Amidi et Shervine Amidi 👥 1.2M 📅 17 octobre 2025 ⏱ 107 min 👁 189K 📄 cours magistral 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

attentionposition embeddingsRoPEBERTmulti-head attention

Résumé

Ce deuxième cours du CME295 de Stanford, donné par Afshine et Shervine Amidi, approfondit les architectures basées sur les transformers. Après un rappel du mécanisme d’attention et de l’architecture originale, le cours se concentre sur les variations et améliorations apportées aux composants clés. La première partie, présentée par Afshine, traite des embeddings de position : embeddings appris, embeddings sinusoïdaux, T5 bias, ALiBi et RoPE. Il explique les motivations de ces méthodes, leurs avantages et limites, notamment la gestion de la longueur des séquences et l’induction de biais de proximité. Ensuite, il aborde la normalisation de couche, l’attention sparse et le partage des têtes d’attention (MHA, MQA, GQA). La seconde partie, présentée par Shervine, passe en revue les modèles dérivés du transformer, avec un focus sur BERT et ses variantes. Il détaille l’architecture de BERT, ses objectifs de pré-entraînement (masked language modeling, next sentence prediction), et les méthodes de fine-tuning pour des tâches en aval. Le cours se conclut sur les extensions de BERT, comme RoBERTa, ALBERT et DistilBERT. L’ensemble est illustré par des exemples concrets et des schémas, et les explications sont claires et pédagogiques.

185 mots

Évaluation critique

Ce cours magistral de Stanford offre une synthèse remarquablement claire et pédagogique des architectures de transformers, en se concentrant sur les évolutions récentes. La valeur des informations est très élevée : les explications sont précises, les formules mathématiques sont présentées avec soin, et les concepts sont contextualisés historiquement. L’argumentation est solide, chaque méthode étant motivée par ses limitations et ses avantages. Par exemple, la discussion sur les embeddings de position montre bien pourquoi les embeddings sinusoïdaux ont été introduits (pour gérer des longueurs de séquence variables) et comment RoPE améliore la gestion des positions relatives. La rigueur scientifique est exemplaire : les intervenants s’appuient sur des papiers fondateurs (Attention is All You Need, BERT, RoFormer) et expliquent les intuitions derrière les mathématiques. Les sources sont de haute qualité, bien que la vidéo ne fournisse pas de bibliographie exhaustive ; les liens vers le syllabus et la playlist sont utiles. L’adéquation titre/contenu est parfaite. Le seul bémol est que le cours suppose une certaine familiarité avec les concepts de base des transformers, mais cela est cohérent avec le niveau master. Les commentaires (non fournis ici) ne sont pas analysés. Dans l’ensemble, ce cours est une excellente ressource pour quiconque souhaite approfondir sa compréhension des modèles de langage modernes.

207 mots

Adéquation titre / contenu

Le titre est parfaitement adéquat : il décrit précisément le contenu (modèles basés sur les transformers et astuces) et le cadre (cours Stanford CME295).

Qualité & fiabilité

9/10

Cours universitaire de niveau master, dispensé par des enseignants de Stanford, avec un contenu technique précis et à jour. Les explications sont rigoureuses et s'appuient sur des références académiques (attention is all you need, BERT, RoPE, etc.). La fiabilité est excellente, bien que le format de cours magistral ne permette pas une vérification indépendante des affirmations.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une mise à jour précieuse sur les évolutions des transformers, en particulier les techniques d’embedding de position (RoPE, ALiBi) et les variantes de partage de têtes (MQA, GQA). Il offre une vue d’ensemble claire des modèles dérivés comme BERT et ses extensions, ce qui est utile pour comprendre la filiation des modèles actuels.

Pour aller plus loin :

146 mots

Profil radar

Le profil radar montre un cours très équilibré, avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est également élevé, ce qui en fait une ressource de référence pour un public averti.

Fiabilité 9/10