HAI Seminar: Code World Models for General Game Playing

HAI Seminar: Code World Models for General Game Playing

🎙 Wolfgang Lehrach 👥 34K 📅 5 juin 2026 ⏱ 50 min 👁 278 📄 exposé scientifique 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

modèle de mondecodejeuLLMplanification

Résumé

L’exposé de Wolfgang Lehrach, chercheur chez DeepMind, présente une approche novatrice pour améliorer la prise de décision dans les jeux en utilisant des modèles de monde codés (CWM). Plutôt que d’utiliser directement un LLM comme politique, la méthode consiste à synthétiser un programme Python exécutable qui simule le jeu, à partir des règles en langage naturel et de trajectoires de jeu. Ce programme sert ensuite de modèle du monde pour un planificateur (MCTS ou RL). L’orateur justifie cette approche par les limites des LLM en tant que politiques (mauvais sur les nouveaux jeux, lenteur, coût du RL) et du code comme politique (difficulté de passage à l’échelle). Il détaille la méthode de synthèse : génération de code, tests unitaires dérivés des trajectoires, et optimisation par un processus itératif. Il mentionne également une seconde approche hybride, où le LLM et le code synthétisé collaborent en ligne, présentée à un atelier ICLR. L’exposé couvre les aspects théoriques et pratiques, avec des exemples concrets comme le morpion. La présentation se termine par une session de questions-réponses.

173 mots

Évaluation critique

L’exposé de Wolfgang Lehrach est d’une grande rigueur scientifique. Il s’appuie sur des travaux publiés dans des conférences majeures (NeurIPS, ICLR), ce qui confère une crédibilité certaine aux résultats présentés. La méthode des modèles de monde codés est bien motivée : l’orateur identifie clairement les limitations des approches existantes (LLM comme politique, code comme politique) et propose une alternative qui les surmonte. L’utilisation de tests unitaires pour valider le code synthétisé est une idée élégante qui exploite les forces des LLM (correction de code) et fournit un retour d’information riche. L’accent mis sur la cohérence entre les règles, les trajectoires et le code est pertinent et montre une réflexion approfondie sur la fiabilité des modèles. Cependant, la transcription est partielle et ne permet pas d’apprécier tous les détails techniques, notamment les résultats expérimentaux chiffrés. L’orateur mentionne que l’approche fonctionne mieux que les alternatives pour un sous-ensemble de jeux, mais sans donner de chiffres précis dans la transcription. Il serait utile de consulter les articles originaux pour une évaluation quantitative. La présentation est claire et bien structurée, avec des exemples concrets (morpion, blackjack) qui facilitent la compréhension. L’adéquation entre le titre et le contenu est parfaite. En résumé, il s’agit d’un exposé de haute qualité, mais la transcription incomplète limite l’évaluation critique approfondie.

212 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : présentation de modèles de monde codés pour le jeu général.

Qualité & fiabilité

8/10

Exposé par un chercheur DeepMind, s'appuyant sur des travaux publiés à NeurIPS et ICLR. La méthode est présentée avec rigueur, mais la transcription est partielle et ne permet pas de vérifier tous les détails techniques.

Moments clés

Sources citées

  • Code World Models for General Game Playing — Article présenté à NeurIPS 2025, détaillant la méthode des modèles de monde codés.
  • Hybrid Code World Models — Article présenté à un atelier ICLR 2026, décrivant l'approche hybride.

Sources concordantes

  • World Coder — Travaux antérieurs sur les modèles de monde codés, mentionnés dans l'exposé.
  • GIF-MCTS — Autre approche de modèles de monde codés, citée dans l'exposé.

Sources discordantes

  • LLM as Policy — L'approche LLM comme politique est critiquée pour ses performances limitées sur les nouveaux jeux, mais elle reste une méthode répandue.

Apport & nouveautés

L’apport principal est la proposition de modèles de monde codés (CWM) qui permettent de transformer des règles de jeu en langage naturel en programmes Python exécutables, surmontant ainsi les limitations des LLM comme politiques directes. Cette approche combine la flexibilité des LLM avec la précision de la planification symbolique. La méthode utilise des tests unitaires dérivés de trajectoires pour valider le code, ce qui améliore la fiabilité. L’approche hybride, où le LLM et le code collaborent en ligne, offre une alternative intéressante pour les jeux où la synthèse complète est difficile.

Pour aller plus loin :

  • Monte Carlo Tree Search — Algorithme de planification utilisé pour résoudre les jeux avec le modèle du monde.
  • Apprentissage par renforcement — Méthode d’optimisation de politique utilisée avec les modèles de monde.
  • World Models — Article fondateur sur les modèles de monde en IA.

140 mots

Profil radar

Le profil radar montre des scores élevés en qualité d'information, niveau technique et fiabilité, avec une quantité d'information modérée. Cela indique un exposé dense et rigoureux, mais peut-être trop spécialisé pour un large public.

Fiabilité 8/10