[ИАД, весна 2026] Математические методы анализа текстов. Лекция 5: LLM Pre-Train

[ИАД, весна 2026] Математические методы анализа текстов. Лекция 5: LLM Pre-Train

🎙 Эльдар 👥 8K 📅 11 mars 2026 ⏱ 44 min 👁 120 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

LLMpre-trainingdata processingscaling lawsmulti-token prediction

Résumé

Cette leçon, donnée en russe, présente les fondements du pré-entraînement des grands modèles de langage (LLM). Le conférencier commence par définir la modélisation du langage comme la prédiction du token suivant, puis distingue les étapes de pré-entraînement, de supervised fine-tuning et de preference tuning, en soulignant l’importance du pré-entraînement comme socle de connaissances. Il insiste sur la qualité des données : nettoyage, déduplication, filtrage linguistique et de qualité, et mentionne l’utilisation de données comme Common Crawl. Ensuite, il aborde les architectures, notamment le transformer decoder, et les lois de scaling qui guident le choix entre taille du modèle et quantité de données. Il présente les tendances actuelles : modèles plus petits mais efficaces, entraînement sur de longs contextes, et techniques comme la prédiction multi-token (utilisée par DeepSeek). Il détaille les méthodes d’attention pour longs contextes : sliding window, global attention, BigBird, et ring attention, ainsi que les positionnal embeddings relatifs comme RoPE. Enfin, il discute des compromis entre longueur de contexte et performance, illustrés par le test de l’aiguille dans la botte de foin. La leçon se termine sur les défis pratiques de l’entraînement sur de longs contextes.

188 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le contenu couvre des aspects essentiels et actuels du pré-entraînement des LLM, avec des exemples concrets (GPT-3, ChatGPT, DeepSeek, Mistral) et des références à des travaux de recherche (lois de scaling, multi-token prediction). L’argumentation est solide, structurée et progressive, passant des concepts de base aux techniques avancées. Le conférencier justifie ses affirmations par des observations empiriques et des exemples, mais sans citer formellement les sources. La discussion sur les compromis (longueur de contexte vs performance) est nuancée et montre une bonne compréhension des enjeux.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est globalement bonne : les concepts sont présentés avec précision, et les techniques décrites correspondent à l’état de l’art. Cependant, aucune source explicite n’est citée dans la vidéo, ce qui limite la vérifiabilité. Le titre est adéquat : il annonce une leçon sur le pré-entraînement des LLM, et le contenu est conforme. La qualité des sources est donc moyenne, mais le niveau technique est correct.

174 mots

Adéquation titre / contenu

Le titre annonce une leçon sur le pré-entraînement des LLM, et le contenu couvre effectivement les aspects clés (données, architecture, tendances), avec une cohérence globale.

Qualité & fiabilité

7/10

Exposé structuré et techniquement précis, s'appuyant sur des concepts établis (lois de scaling, architectures récentes) et des références implicites à des travaux connus. Quelques imprécisions mineures et absence de sources explicites.

Moments clés

Apport & nouveautés

La leçon apporte une synthèse claire et à jour des méthodes de pré-entraînement des LLM, en mettant l’accent sur l’importance des données et les techniques récentes comme la prédiction multi-token. Elle offre une perspective pratique sur les compromis à faire.

Pour aller plus loin :

109 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et un niveau technique correct, mais une fiabilité moyenne due à l'absence de sources explicites. La qualité de l'information est bonne, mais pourrait être améliorée par des références précises.

Fiabilité 7/10