[ИАД, весна 2026] Математические методы анализа текстов. Лекция 7: Training LLMs от 31.03.2026

[ИАД, весна 2026] Математические методы анализа текстов. Лекция 7: Training LLMs от 31.03.2026

🎙 Machine Learning – Intelligent Systems 👥 8K 📅 16 mai 2026 ⏱ 60 min 👁 77 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

LLMentraînementGPUmémoireparallélisme

Résumé

Cette septième leçon du cours sur les méthodes mathématiques d’analyse de textes aborde l’entraînement des grands modèles de langage (LLM). L’enseignant commence par motiver l’importance du sujet en citant des exemples concrets comme Llama 3 (405B paramètres, 16 000 GPU) et DeepSeek-V3 (2 000 GPU). Il identifie trois défis fondamentaux : la mémoire, l’efficacité de calcul et la communication. Ensuite, il détaille les composants de la mémoire GPU lors de l’entraînement : paramètres, gradients, état de l’optimiseur et activations. Il explique pourquoi l’entraînement en simple précision (FP32) est impossible pour les grands modèles, en prenant l’exemple d’un modèle 7B qui nécessiterait 112 Go pour les paramètres, gradients et optimiseur. Il introduit la notion de précision mixte (FP16, BF16) et son intérêt pour réduire la mémoire des activations et accélérer les calculs via les tensor cores. Il présente ensuite deux techniques pour gérer la mémoire des activations : le gradient checkpointing (full et selective) et le gradient accumulation. Enfin, il annonce que la suite du cours couvrira le parallélisme de données et la technique ZeRO, ainsi que FSDP.

177 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le cours fournit des explications claires et structurées sur des concepts complexes, avec des exemples chiffrés concrets (taille mémoire, coûts). L’argumentation est solide, s’appuyant sur des références reconnues comme le playbook de Hugging Face et des modèles récents. L’enseignant adopte une approche progressive, partant des bases pour aboutir à des techniques avancées, ce qui facilite la compréhension.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les sources mentionnées sont pertinentes et à jour (Hugging Face, Llama 3, DeepSeek-V3). La qualité des sources est satisfaisante, bien que l’enseignant ne fournisse pas de citations formelles dans la transcription. L’adéquation titre/contenu est bonne : le titre annonce une leçon sur l’entraînement des LLM, et le contenu correspond exactement à cela.

137 mots

Adéquation titre / contenu

Le titre annonce une leçon sur l'entraînement des LLM, et le contenu couvre effectivement les techniques de parallélisme et de gestion de mémoire, conformément au programme.

Qualité & fiabilité

8/10

Le contenu est un cours universitaire structuré, s'appuyant sur des références reconnues (playbook Hugging Face, modèles Llama 3, DeepSeek-V3) et des techniques établies (mixed precision, ZeRO, FSDP). Les explications sont techniquement précises et cohérentes avec l'état de l'art.

Moments clés

Sources citées

  • Hugging Face Playbook — Guide pratique pour l'entraînement distribué de grands modèles, mentionné comme référence principale.

Sources concordantes

  • Hugging Face Playbook — Guide pratique pour l'entraînement distribué, cohérent avec les techniques présentées.

Apport & nouveautés

La leçon apporte une synthèse claire et pédagogique des techniques d’entraînement distribué, en les reliant à des exemples concrets. Elle met l’accent sur les compromis mémoire/calcul/communication, ce qui est essentiel pour comprendre les choix d’ingénierie.

Pour aller plus loin :

90 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés (8/10) sur les quatre axes, indiquant une qualité homogène : bonne quantité d'informations, qualité technique solide, niveau technique avancé et fiabilité globale satisfaisante.

Fiabilité 8/10