Nash and Nemirovski walk into a bar: LLM alignment with Mirror Descent and Proximal Methods

Nash and Nemirovski walk into a bar: LLM alignment with Mirror Descent and Proximal Methods

🎙 Dr. Michal Valko 👥 8K 📅 14 novembre 2025 ⏱ 50 min 👁 385 📄 exposé scientifique 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

LLMalignementNash equilibriummirror descentpreference model

Résumé

L’exposé de Dr. Michal Valko, donné dans le cadre d’un atelier sur le contrôle stochastique et l’apprentissage par renforcement, propose une critique de la méthode standard d’alignement des grands modèles de langage (LLM) basée sur le modèle de Bradley-Terry et l’optimisation par RLHF. Il introduit une alternative fondée sur la théorie des jeux, en remplaçant le modèle de récompense par un modèle de préférence et en cherchant à atteindre un équilibre de Nash plutôt qu’une simple meilleure réponse. L’orateur justifie ce changement par des limitations pratiques et théoriques du paradigme actuel, notamment la non-transitivité des préférences humaines et la sensibilité aux données. Il présente des résultats expérimentaux préliminaires montrant une amélioration de la performance de prédiction des préférences. La seconde partie de l’exposé aborde les défis de l’optimisation dans les jeux à information imparfaite, en s’appuyant sur des travaux antérieurs sur l’exploration implicite et en proposant des pistes pour adapter ces méthodes aux LLM. L’ensemble est technique et s’adresse à un public de spécialistes.

164 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

L’exposé apporte une valeur certaine en remettant en question un paradigme établi (RLHF) et en proposant une alternative théoriquement fondée. L’argumentation est solide, s’appuyant sur des exemples concrets (ELO, préférences non transitives) et des résultats expérimentaux. L’orateur reconnaît les limites de son approche et les questions ouvertes, ce qui renforce la crédibilité. La démonstration de l’intérêt de l’équilibre de Nash pour l’alignement est convaincante, même si les aspects pratiques restent à développer.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est élevée : l’orateur cite des travaux de recherche (dont les siens) et s’appuie sur des expériences. Les sources mentionnées sont pertinentes et les liens fournis dans la description (site de l’INI, page de l’événement) permettent de contextualiser. Le titre est adéquat, bien que légèrement humoristique, il reflète bien le contenu. Aucune publicité n’est présente.

145 mots

Adéquation titre / contenu

Le titre, bien que ludique, reflète bien le contenu : l'utilisation de concepts de théorie des jeux (Nash) et d'optimisation (Nemirovski) pour l'alignement des LLM.

Qualité & fiabilité

8/10

Exposé scientifique de haut niveau, s'appuyant sur des travaux de recherche publiés et des expériences pratiques. L'orateur est un chercheur reconnu (INRIA, participation à Gemini et Llama 3). Les propos sont nuancés et critiques, avec des références explicites à des travaux antérieurs.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

L’exposé propose une refonte conceptuelle de l’alignement des LLM en le formulant comme un problème de recherche d’équilibre de Nash dans un jeu à deux joueurs, plutôt que comme une optimisation d’une récompense scalaire. Cette approche permet de s’affranchir de l’hypothèse de transitivité des préférences et d’obtenir des politiques plus robustes et moins sensibles aux biais de collecte des données. Les résultats préliminaires montrent une amélioration de la prédiction des préférences humaines. L’orateur discute également des défis pratiques pour adapter les algorithmes de théorie des jeux aux LLM, notamment en ce qui concerne la gestion de l’incertitude et l’évolutivité.

Pour aller plus loin :

  • Équilibre de Nash — Concept central de la théorie des jeux.
  • Mirror descent — Algorithme d’optimisation utilisé dans les méthodes proximales.
  • Apprentissage par renforcement à partir de retours humains (RLHF) — Méthode standard d’alignement des LLM.

140 mots

Profil radar

Le profil radar montre un exposé très technique (niveau technique élevé) avec une excellente qualité d'information et une bonne fiabilité. La quantité d'information est également élevée, mais l'exposé est dense et peut être difficile à suivre pour un public non spécialiste.

Fiabilité 8/10