Train Your Own LLM – Tutorial

Train Your Own LLM – Tutorial

🎙 Imad Saddik (présenté par freeCodeCamp.org) 👥 11.8M 📅 10 avril 2025 ⏱ 209 min 👁 405K 📄 tutoriel 🧭 2026-08-06
Disponible en : Français (actuel) English

Mots-clés

LLMBPETransformerfine-tuningDarija

Résumé

Ce tutoriel complet de 3h29, présenté par Imad Saddik sur la chaîne freeCodeCamp, apprend aux débutants à entraîner un modèle de langage de A à Z, en prenant l’exemple du darija marocain. Le cours est divisé en deux parties : une première partie à petite échelle pour comprendre les concepts, puis une seconde partie pour passer à l’échelle. Le pipeline couvre l’extraction de données depuis WhatsApp, le nettoyage, la tokenization avec Byte Pair Encoding (BPE), l’architecture Transformer, le pré-entraînement, la création d’un jeu de données de fine-tuning supervisé, et le fine-tuning avec LoRA. L’auteur fournit des notebooks, scripts et jeux de données sur GitHub et Hugging Face. Le cours met l’accent sur la création d’un modèle capable d’imiter le style de communication d’une personne, avec des applications pour les langues sous-représentées. La pédagogie est progressive, avec des explications claires et des ressources complémentaires. La conclusion propose des pistes pour aller plus loin, comme l’évolution de l’architecture Transformer.

157 mots

Évaluation critique

Ce tutoriel est une ressource exceptionnelle pour quiconque souhaite comprendre et maîtriser le processus complet d’entraînement d’un LLM. La valeur pédagogique est remarquable : l’auteur adopte une approche progressive, commençant par des concepts simples (tokenization, architecture) avant de passer à des aspects plus avancés (fine-tuning avec LoRA, passage à l’échelle). La rigueur scientifique est solide : les explications sont précises, les choix techniques sont justifiés (par exemple, le choix du BPE pour équilibrer taille du vocabulaire et longueur des séquences), et les sources sont citées (articles Wikipédia, cours Hugging Face, vidéos de référence). La qualité des sources est excellente : les dépôts GitHub et les jeux de données sur Hugging Face sont publics et vérifiables, ce qui renforce la crédibilité. L’adéquation titre/contenu est parfaite : le titre annonce un tutoriel pour entraîner son propre LLM, et c’est exactement ce qui est délivré. Le seul bémol est que certaines parties pourraient être plus approfondies, notamment sur les hyperparamètres ou les stratégies d’optimisation, mais cela reste un cours d’introduction. Les commentaires sont extrêmement positifs, saluant la clarté, la générosité et l’impact du cours. En résumé, c’est une référence pour les débutants et une excellente base pour les plus avancés.

197 mots

Adéquation titre / contenu

Le titre est parfaitement adéquat : le cours guide pas à pas l'apprenant dans l'entraînement complet d'un LLM, de la collecte des données à l'assistant conversationnel.

Qualité & fiabilité

9/10

Le cours est structuré, pédagogique, et s'appuie sur des ressources open source vérifiables (dépôts GitHub, jeux de données Hugging Face). L'auteur explique les concepts fondamentaux (tokenization BPE, architecture Transformer, pré-entraînement, fine-tuning) avec des exemples concrets. La démarche est transparente et reproductible.

Moments clés

Sources citées

Sources concordantes

Références externes

Apport & nouveautés

Ce cours apporte une approche pratique et complète pour entraîner un LLM de zéro, en utilisant des données de chat personnelles. L’originalité réside dans l’application à une langue sous-représentée (le darija), ce qui illustre la faisabilité pour d’autres langues. Il fournit des ressources open source réutilisables et une méthodologie claire.

Pour aller plus loin :

106 mots

Profil radar

Le profil radar montre un excellent équilibre entre la quantité et la qualité de l'information, avec une fiabilité élevée. Le niveau technique est élevé mais accessible, ce qui en fait une ressource de référence pour les débutants comme pour les initiés.

Fiabilité 9/10

💬 Très positif. Sur les 30 commentaires analysés, une grande majorité exprime une gratitude sincère et une admiration pour la qualité pédagogique du cours, avec des remarques sur l'impact pour les langues sous-représentées et la générosité de l'auteur.