LLMs from Scratch – Practical Engineering from Base Model to PPO RLHF

LLMs from Scratch – Practical Engineering from Base Model to PPO RLHF

🎙 Vivek Kalyanarangan 👥 11.8M 📅 23 septembre 2025 ⏱ 366 min 👁 189K 📄 tutoriel 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

transformerattentionfine-tuningrécompensePPO

Résumé

Cette vidéo de 6 heures, produite par freeCodeCamp, propose un tutoriel pratique complet pour construire un grand modèle de langage (LLM) de zéro en utilisant uniquement PyTorch. Le formateur, Vivek Kalyanarangan, guide les apprenants à travers toutes les étapes : architecture transformer de base, entraînement d’un petit modèle, modernisation avec des techniques comme RoPE, RMSNorm, SwiGLU, cache KV, attention à fenêtre glissante, puis passage à l’échelle avec tokenisation BPE, accumulation de gradient et précision mixte. Ensuite, il aborde les mixture-of-experts (MoE), le supervised fine-tuning (SFT), la modélisation de récompense avec des fonctions de perte comme Bradley-Terry et margin ranking, et enfin le RLHF avec PPO. Le cours est structuré en 8 parties, chacune avec du code modulaire et commenté disponible sur GitHub. L’objectif est de fournir une compréhension approfondie des mécanismes internes des LLM, en mettant l’accent sur l’implémentation pratique. Le formateur recommande de regarder la vidéo à 1,5x ou 2x pour les personnes à l’aise. La vidéo inclut une séquence publicitaire pour la plateforme Scrimba, mais elle n’affecte pas la qualité du contenu.

174 mots

Évaluation critique

Cette vidéo est une ressource exceptionnelle pour quiconque souhaite comprendre et implémenter les LLM en profondeur. La valeur principale réside dans son approche pratique : chaque concept théorique est immédiatement suivi d’une implémentation en PyTorch, ce qui permet de saisir les détails souvent négligés dans les présentations théoriques. La progression est logique, partant des fondements du transformer jusqu’aux techniques avancées de RLHF, en passant par des optimisations modernes comme RoPE et MoE. La rigueur scientifique est bonne : les explications s’appuient sur des papiers fondateurs (Attention is All You Need, etc.) et le code est fourni, ce qui permet une vérification. Cependant, on peut regretter que certaines parties théoriques soient survolées, mais cela est compensé par la richesse du code. La qualité des sources est correcte, avec des références aux travaux de Umar Jamil et Sebastian Raschka, mais il n’y a pas de citation formelle de papiers dans la vidéo elle-même. L’adéquation entre le titre et le contenu est parfaite : le titre annonce exactement ce qui est délivré. Les commentaires sont extrêmement positifs, les apprenants apprécient la clarté et la profondeur du contenu. Certains demandent des extensions sur des sujets connexes comme GRPO ou les techniques de DeepSeek, ce qui témoigne de l’intérêt suscité. En résumé, cette vidéo est une référence pour l’apprentissage pratique des LLM, avec une note globale de 5/5.

223 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : construction complète d'un LLM de zéro jusqu'au RLHF.

Qualité & fiabilité

8/10

Contenu technique dense, code fourni, approche pédagogique progressive, sources citées (papiers fondateurs) mais pas de vérification indépendante.

Chapitres

Sources citées

  • Code source du cours — Référentiel contenant tout le code présenté dans la vidéo.
  • freeCodeCamp — Organisation à but non lucratif qui héberge la vidéo et propose des ressources d'apprentissage.
  • freeCodeCamp News — Articles et tutoriels complémentaires sur la programmation.

Sources concordantes

Références externes

Apport & nouveautés

L’apport principal de cette vidéo est de fournir un parcours complet et cohérent pour construire un LLM de zéro, en couvrant à la fois les aspects fondamentaux et les techniques de pointe, le tout avec du code exécutable. Elle comble un manque en offrant une vue d’ensemble pratique du pipeline complet, de la préformation au RLHF, ce qui est rare dans les tutoriels en ligne.

Pour aller plus loin :

126 mots

Profil radar

Le profil radar montre des scores élevés en quantité d'information, qualité et niveau technique, avec une fiabilité légèrement inférieure mais toujours bonne. Cela indique un contenu très dense et technique, mais avec une fiabilité qui pourrait être renforcée par des citations plus explicites.

Fiabilité 8/10

💬 Très positif : sur les 30 commentaires analysés, la grande majorité exprime une gratitude et une admiration pour la qualité du cours, certains demandant des extensions sur des sujets connexes.