[M2L 2025] 3.2 Reinforcement Learning for LLMs - Jessica Hamrick

[M2L 2025] 3.2 Reinforcement Learning for LLMs - Jessica Hamrick

🎙 Jessica Hamrick 👥 3K 📅 12 novembre 2025 ⏱ 51 min 👁 234 📄 revue de littérature 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

RLHFRLVRDPOPPOreasoning

Résumé

Cette présentation de Jessica Hamrick (ex-DeepMind) offre une vue d’ensemble du reinforcement learning appliqué aux grands modèles de langage (LLM). Après un rappel sur le pré-entraînement et le supervised fine-tuning (SFT), elle explique comment le RL permet d’aligner les modèles sur des objectifs humains. Elle détaille les différentes familles de récompenses : RLHF (préférences humaines), RLVR (récompenses vérifiables, ex. mathématiques), RLEF (feedback d’exécution, ex. code) et RLAIF (feedback d’un autre LLM). Elle illustre avec des exemples concrets comme ChatGPT, OpenAI o1, DeepSeek-R1 et Claude Code. Elle explique le fonctionnement de PPO (Proximal Policy Optimization) et introduit DPO comme alternative plus simple. Enfin, elle évoque des questions de recherche ouvertes, notamment l’équilibre entre exploration et exploitation, et l’importance de la diversité des données.

122 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : la présentatrice maîtrise son sujet et fournit une synthèse claire des méthodes de RL pour LLM, avec des références précises aux travaux récents. L’argumentation est solide, appuyée sur des exemples concrets (o1, DeepSeek-R1) et des graphiques de performance. Elle prend soin de distinguer les différentes approches et leurs domaines d’application, ce qui renforce la crédibilité du propos.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les sources citées sont des papiers fondateurs (InstructGPT, DPO, DeepSeek-R1) et des modèles bien connus. La qualité des sources est élevée, même si aucune référence bibliographique complète n’est fournie dans la description. L’adéquation titre/contenu est parfaite : le titre annonce un cours sur le RL pour LLM et la vidéo tient cette promesse.

138 mots

Adéquation titre / contenu

Le titre annonce un cours sur le RL pour LLM ; la vidéo correspond parfaitement, avec une progression logique et des exemples concrets.

Qualité & fiabilité

8/10

Exposé structuré par une chercheuse expérimentée (ex-DeepMind), couvrant les principaux paradigmes de RL pour LLM (RLHF, RLVR, RLEF, RLAIF) avec des références aux papiers fondateurs (InstructGPT, DPO, DeepSeek-R1). Le contenu est factuel et à jour, mais il s'agit d'une vue d'ensemble sans démonstration expérimentale originale.

Moments clés

Sources citées

  • InstructGPT paper — Cité pour le problème d'alignement et l'introduction de RLHF.
  • DeepSeek-R1 — Cité pour l'application de RLVR au raisonnement.
  • DPO paper — Cité comme alternative à RLHF.
  • Flan paper — Cité pour l'instruction tuning.

Sources concordantes

  • InstructGPT paper — Confirme l'efficacité de RLHF pour l'alignement.
  • DeepSeek-R1 — Confirme l'efficacité de RLVR pour le raisonnement.

Apport & nouveautés

Cette vidéo apporte une synthèse claire et structurée des méthodes de RL pour LLM, en les reliant aux développements récents (o1, DeepSeek-R1, Claude Code). Elle met en lumière les différences entre les types de récompenses et leurs applications, ce qui est utile pour comprendre les choix de conception des modèles actuels.

Pour aller plus loin :

100 mots

Profil radar

Le profil radar montre une bonne performance sur tous les axes, avec une légère prédominance de la quantité d'information et de la fiabilité. La qualité et le niveau technique sont également élevés, ce qui indique un contenu dense et fiable.

Fiabilité 8/10