[ИАД, весна 2026] Математические методы анализа текстов. Лекция 12: Alignment от 14.05.2026

[ИАД, весна 2026] Математические методы анализа текстов. Лекция 12: Alignment от 14.05.2026

🎙 Machine Learning – Intelligent Systems 👥 8K 📅 15 mai 2026 ⏱ 60 min 👁 122 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

alignementRLHFDPOGRPOpréférences humaines

Résumé

Cette leçon, dispensée en russe, aborde les méthodes mathématiques d’alignement des modèles de langue sur les préférences humaines. Le conférencier commence par motiver le problème : les modèles entraînés par prédiction du prochain token peuvent produire des réponses toxiques, hallucinées ou non conformes aux attentes. Il introduit ensuite le cadre formel : politique, récompense, processus de décision markovien, et la modélisation des préférences via le modèle de Bradley-Terry. Il détaille l’approche classique RLHF, qui comprend trois étapes : fine-tuning supervisé, entraînement d’un modèle de récompense, et optimisation par PPO. Il souligne les inconvénients de cette approche : coût élevé, instabilité, et nécessité de nombreux hyperparamètres. Il présente ensuite DPO, qui reformule le problème pour éliminer le modèle de récompense explicite et l’étape RL, en optimisant directement une fonction de perte basée sur les rapports de probabilités. Il mentionne également GRPO et d’autres variantes. La leçon se conclut par une discussion des avantages et limites de ces méthodes, notamment les problèmes de sur-optimisation et de biais de longueur.

167 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le cours fournit une base mathématique solide pour comprendre l’alignement, avec des dérivations claires de la fonction de perte DPO à partir du cadre RLHF. L’argumentation est structurée et progressive, partant du problème général pour aboutir à des solutions concrètes. Le conférencier justifie chaque étape et compare les approches, ce qui renforce la crédibilité du contenu.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les concepts sont présentés avec précision et les dérivations sont correctes. Les sources ne sont pas explicitement citées dans la vidéo, mais les méthodes évoquées (RLHF, DPO, GRPO) sont bien établies dans la littérature. Le titre est en adéquation avec le contenu, qui est une leçon magistrale sur les méthodes mathématiques d’analyse de textes, spécifiquement sur l’alignement.

141 mots

Adéquation titre / contenu

Le titre correspond exactement au contenu : il s'agit de la 12e leçon d'un cours sur les méthodes mathématiques d'analyse de textes, consacrée à l'alignement.

Qualité & fiabilité

8/10

Cours universitaire structuré, présentant les fondements mathématiques de l'alignement de modèles de langue, avec des dérivations explicites et des références à des méthodes établies (RLHF, DPO, GRPO). Le contenu est technique et précis, mais la présentation orale est informelle et certaines formules sont approximatives.

Moments clés

Apport & nouveautés

Cette leçon apporte une explication pédagogique claire et détaillée des méthodes d’alignement, en particulier la transition de RLHF à DPO. Elle met en lumière les compromis entre coût, stabilité et performance. Pour aller plus loin :

94 mots

Profil radar

Le profil radar montre un niveau élevé et équilibré sur les quatre axes, avec une légère prédominance de la qualité et de la fiabilité, reflétant un contenu technique solide et bien structuré.

Fiabilité 8/10