Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 4 - LLM Training

Stanford CME295 Transformers & LLMs | Autumn 2025 | Lecture 4 - LLM Training

🎙 Afshine Amidi et Shervine Amidi 👥 1.2M 📅 21 octobre 2025 ⏱ 107 min 👁 96K 📄 cours magistral 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

pré-entraînementscaling lawsquantificationfine-tuning superviséLoRA

Résumé

Ce cours de Stanford, donné par Afshine et Shervine Amidi, constitue la quatrième leçon du module CME295 sur les Transformers et les LLM. Il se concentre sur les différentes étapes de l’entraînement des grands modèles de langage. Après un rappel des concepts clés des leçons précédentes (attention, mixture of experts, décodage), les intervenants détaillent la phase de pré-entraînement, qui consiste à entraîner le modèle sur d’immenses corpus textuels pour prédire le token suivant. Ils introduisent les notions de FLOPs et de FLOPS, puis présentent les lois d’échelle (scaling laws) et la loi de Chinchilla, qui guident le choix de la taille du modèle et du nombre de tokens. La suite du cours aborde les techniques d’optimisation matérielle et logicielle : parallélisme de données avec ZeRO, parallélisme de modèle, Flash Attention, quantification et entraînement en précision mixte. Enfin, ils expliquent le fine-tuning supervisé (SFT) et l’instruction tuning, avant de détailler les méthodes de fine-tuning efficaces en paramètres, notamment LoRA et QLoRA. Le tout est illustré par des exemples concrets et des références à des modèles récents comme GPT-3 et Llama 3.

180 mots

Évaluation critique

Ce cours magistral de Stanford offre une introduction complète et rigoureuse à l’entraînement des grands modèles de langage. La valeur des informations est élevée : les concepts sont présentés de manière claire et progressive, avec des définitions précises (FLOPs vs FLOPS, scaling laws, ZeRO, Flash Attention, LoRA) et des ordres de grandeur utiles (nombre de tokens, coût de calcul). L’argumentation est solide, s’appuyant sur des résultats de recherche publiés (lois d’échelle, Chinchilla) et des techniques largement adoptées dans l’industrie. La rigueur scientifique est bonne, même si le format magistral implique parfois des simplifications (par exemple, la formule des FLOPs est donnée de manière approximative). Les sources sont de qualité : le cours fait partie d’un programme universitaire reconnu, et les intervenants sont des experts du domaine. L’adéquation entre le titre et le contenu est parfaite. On peut toutefois regretter que certains sujets, comme la quantification ou Flash Attention, soient traités de manière relativement succincte, mais cela reste cohérent avec la durée du cours. Dans l’ensemble, il s’agit d’une ressource pédagogique de très haute qualité, adaptée à un public ayant déjà des bases en apprentissage automatique.

185 mots

Adéquation titre / contenu

Le titre décrit exactement le contenu : une leçon sur l'entraînement des LLM, conforme au programme du cours.

Qualité & fiabilité

9/10

Cours universitaire de Stanford, présenté par des enseignants experts, avec un contenu technique précis et à jour (scaling laws, ZeRO, Flash Attention, LoRA, QLoRA). Les explications sont structurées et s'appuient sur des références académiques reconnues. La rigueur est élevée, bien que le format magistral limite la profondeur sur certains points.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

Cette vidéo apporte une synthèse claire et structurée des techniques d’entraînement des LLM, en reliant les concepts théoriques (scaling laws, FLOPs) aux implémentations pratiques (ZeRO, Flash Attention, LoRA). Elle est particulièrement utile pour les étudiants ou professionnels souhaitant acquérir une vision d’ensemble du processus d’entraînement, avec des références aux modèles récents (GPT-3, Llama 3).

Pour aller plus loin :

178 mots

Profil radar

Le profil radar montre une très bonne couverture sur tous les axes, avec une légère prédominance de la quantité d'information et de la fiabilité. Cela reflète un cours dense et fiable, mais avec un niveau technique accessible, ce qui est cohérent avec un public étudiant.

Fiabilité 9/10