[ИАД, осень 2025] Методы глубокого обучения. Занятие 8: Multi-armed Bandits, Monte Carlo Methods

[ИАД, осень 2025] Методы глубокого обучения. Занятие 8: Multi-armed Bandits, Monte Carlo Methods

🎙 Machine Learning – Intelligent Systems 👥 8K 📅 28 octobre 2025 ⏱ 186 min 👁 164 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

apprentissage par renforcementprocessus de décision markovienpolitiquerécompenseméthodes de Monte Carlo

Résumé

Ce cours magistral, dispensé dans le cadre d’un module d’intelligence artificielle, introduit les concepts fondamentaux de l’apprentissage par renforcement (RL). L’enseignant commence par motiver le RL en contrastant avec l’apprentissage supervisé et non supervisé, en prenant l’exemple de l’apprentissage de la marche chez l’enfant. Il définit ensuite les notions d’agent, d’environnement, d’état, d’action et de récompense, et formalise le problème comme la maximisation de l’espérance de la somme des récompenses. Une attention particulière est portée à la propriété de Markov, qui simplifie la modélisation en supposant que la transition et la récompense ne dépendent que de l’état et de l’action courants. Le cours aborde également la notion de politique (stratégie) et d’optimalité. La transcription s’arrête avant le développement des méthodes de Monte Carlo et des bandits multi-bras, bien que le titre les mentionne. Le style est interactif, avec des questions posées aux étudiants, et le niveau est celui d’un cours universitaire de deuxième ou troisième année.

156 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public étudiant : les concepts sont expliqués de manière intuitive et progressive, avec des exemples concrets (marche de l’enfant, jeu pierre-feuille-ciseaux, échecs). L’argumentation est solide, s’appuyant sur une formalisation mathématique progressive (définition de la politique, de la récompense, de l’objectif). L’enseignant prend soin de justifier les choix de modélisation, comme la propriété de Markov, en expliquant ses implications. La démarche pédagogique est claire et structurée, bien que le cours soit long et parfois redondant.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les définitions sont précises et les notations sont cohérentes. Cependant, aucune source n’est citée dans la transcription, ce qui limite la vérifiabilité. Le titre mentionne ‘Méthodes de deep learning’ et ‘Multi-armed Bandits, Monte Carlo Methods’, mais le contenu de la transcription ne couvre que les bases du RL, sans aborder explicitement les bandits ni les méthodes de Monte Carlo. Cette inadéquation est notable, mais elle peut s’expliquer par le fait que la transcription est partielle (le cours dure 3h06, et la transcription s’arrête après environ 1h30).

189 mots

Adéquation titre / contenu

Le titre annonce un cours sur les méthodes d'apprentissage profond, mais le contenu se concentre sur les bases de l'apprentissage par renforcement (bandits, méthodes de Monte Carlo), ce qui est partiellement en adéquation.

Qualité & fiabilité

8/10

Cours universitaire structuré, présentant les fondements théoriques de l'apprentissage par renforcement (processus de décision markovien, politiques, récompenses) avec des exemples pédagogiques. La rigueur est bonne, mais l'absence de sources explicites et le format oral limitent la vérifiabilité.

Moments clés

Apport & nouveautés

Ce cours apporte une introduction pédagogique solide aux concepts de base de l’apprentissage par renforcement, avec une formalisation progressive et des exemples concrets. Il ne présente pas de nouveauté scientifique, mais constitue une ressource utile pour les étudiants. Pour aller plus loin :

84 mots

Profil radar

Le profil radar montre un bon équilibre entre la quantité et la qualité de l'information, avec un niveau technique élevé. La fiabilité est bonne, mais pourrait être renforcée par des références explicites.

Fiabilité 8/10