![[ИАД, весна 2026] Математические методы анализа текстов. Лекция 12: Alignment от 14.05.2026](https://i.ytimg.com/vi/m1gTVHQ3h9o/sddefault.jpg)
[ИАД, весна 2026] Математические методы анализа текстов. Лекция 12: Alignment от 14.05.2026
Mots-clés
Résumé
167 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : le cours fournit une base mathématique solide pour comprendre l’alignement, avec des dérivations claires de la fonction de perte DPO à partir du cadre RLHF. L’argumentation est structurée et progressive, partant du problème général pour aboutir à des solutions concrètes. Le conférencier justifie chaque étape et compare les approches, ce qui renforce la crédibilité du contenu.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : les concepts sont présentés avec précision et les dérivations sont correctes. Les sources ne sont pas explicitement citées dans la vidéo, mais les méthodes évoquées (RLHF, DPO, GRPO) sont bien établies dans la littérature. Le titre est en adéquation avec le contenu, qui est une leçon magistrale sur les méthodes mathématiques d’analyse de textes, spécifiquement sur l’alignement.
141 mots
Adéquation titre / contenu
Le titre correspond exactement au contenu : il s'agit de la 12e leçon d'un cours sur les méthodes mathématiques d'analyse de textes, consacrée à l'alignement.
Qualité & fiabilité
8/10
Cours universitaire structuré, présentant les fondements mathématiques de l'alignement de modèles de langue, avec des dérivations explicites et des références à des méthodes établies (RLHF, DPO, GRPO). Le contenu est technique et précis, mais la présentation orale est informelle et certaines formules sont approximatives.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et motivation : problèmes des modèles non alignés (exemple des pierres).
- Présentation du cadre formel : politique, récompense, MDP.
- Modèle de Bradley-Terry pour modéliser les préférences.
- Dérivation de la politique optimale avec KL-divergence.
- Pipeline RLHF : SFT, récompense, PPO.
- Problèmes de RLHF : coût, instabilité, reward hacking.
- Introduction de DPO : reformulation sans modèle de récompense.
- Dérivation de la perte DPO et comparaison avec RLHF.
- Avantages et limites de DPO, mention de GRPO.
- Conclusion et perspectives.
Apport & nouveautés
Cette leçon apporte une explication pédagogique claire et détaillée des méthodes d’alignement, en particulier la transition de RLHF à DPO. Elle met en lumière les compromis entre coût, stabilité et performance. Pour aller plus loin :
- Direct Preference Optimization (DPO) — Article original de Rafailov et al. (2023) présentant DPO.
- Proximal Policy Optimization (PPO) — Article de Schulman et al. (2017) décrivant l’algorithme PPO.
- RLHF — Article de Ouyang et al. (2022) sur InstructGPT, une application majeure de RLHF.
- Bradley-Terry model — Page Wikipédia sur le modèle de Bradley-Terry utilisé pour modéliser les préférences.
94 mots
Profil radar
Le profil radar montre un niveau élevé et équilibré sur les quatre axes, avec une légère prédominance de la qualité et de la fiabilité, reflétant un contenu technique solide et bien structuré.