Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 7: Dynamic Programming

Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 7: Dynamic Programming

🎙 Prof. Marco Pavone 👥 1.2M 📅 12 août 2026 ⏱ 75 min 👁 48 📄 cours magistral 🧭 2026-08-12
Disponible en : Français (actuel) English

Mots-clés

programmation dynamiqueprincipe d'optimalitéLQRéquation de Riccaticontrôle en boucle fermée

Résumé

Ce cours de Stanford, donné par le professeur Marco Pavone, introduit la programmation dynamique comme méthode de résolution de problèmes de contrôle optimal en boucle fermée. Après un rappel des méthodes en boucle ouverte (indirectes et directes), le professeur explique la nécessité de passer à des politiques de contrôle en boucle fermée pour faire face aux perturbations et aux erreurs de modèle. Il présente le principe d’optimalité, qui stipule que la fin d’une séquence de contrôle optimale est optimale pour le problème tronqué, et en donne une preuve par contradiction. Ce principe permet de résoudre le problème de manière récursive en partant de la fin, en utilisant la fonction coût-pour-aller. Un exemple de plus court chemin illustre la mécanique de l’algorithme. Le cours se poursuit avec l’étude du cas particulier du régulateur linéaire quadratique (LQR), où la programmation dynamique se simplifie en une récurrence sur des matrices, aboutissant aux équations de Riccati. Le professeur souligne l’importance de ce résultat pour de nombreuses applications en robotique et en contrôle, et mentionne les défis liés à la dimensionnalité et à la modélisation.

180 mots

Évaluation critique

Ce cours magistral de niveau universitaire offre une introduction rigoureuse et pédagogique à la programmation dynamique pour le contrôle optimal. Le professeur Marco Pavone, expert reconnu dans le domaine, structure son exposé de manière claire et progressive. Il commence par rappeler le contexte du cours et la distinction entre contrôle en boucle ouverte et en boucle fermée, justifiant l’intérêt de cette dernière pour la robustesse. Le principe d’optimalité est énoncé et démontré par contradiction, ce qui ancre solidement le raisonnement. L’exemple du plus court chemin est très efficace pour illustrer la mécanique de l’algorithme et l’importance de la réutilisation des calculs. La dérivation du LQR est menée de manière détaillée, montrant comment la programmation dynamique se réduit à une récurrence matricielle simple, aboutissant aux équations de Riccati. Le professeur prend soin de souligner les limites de la méthode, notamment le fléau de la dimensionnalité, et ouvre des perspectives vers des méthodes approchées. Les interactions avec les étudiants montrent une volonté de clarifier les points délicats. La qualité des sources est excellente : le cours s’appuie sur un manuel de référence et des supports de cours disponibles en ligne. L’adéquation entre le titre et le contenu est parfaite. En conclusion, ce cours est d’une grande valeur pédagogique et scientifique, offrant une base solide pour comprendre les méthodes de contrôle optimal en boucle fermée.

222 mots

Adéquation titre / contenu

Le titre est parfaitement adéquat : il s'agit bien de la septième leçon du cours AA203, consacrée à la programmation dynamique.

Qualité & fiabilité

9/10

Cours universitaire de niveau master, dispensé par un professeur de Stanford, avec un support de cours et un manuel de référence. Le contenu est rigoureux, les démonstrations sont claires et les concepts sont bien contextualisés.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une introduction claire et rigoureuse à la programmation dynamique pour le contrôle optimal, en mettant l’accent sur le principe d’optimalité et son application au LQR. Il fournit une base solide pour comprendre les méthodes de contrôle en boucle fermée et leurs applications en robotique.

Pour aller plus loin :

  • Programmation dynamique (Wikipédia) — Article de référence sur la méthode générale.
  • Équation de Riccati (Wikipédia) — Article sur les équations de Riccati, centrales dans le LQR.
  • Régulateur linéaire quadratique (Wikipédia) — Article dédié au LQR.
  • Principe d’optimalité de Bellman (Wikipédia) — Article sur le principe d’optimalité.

98 mots

Profil radar

Le profil radar montre un niveau élevé dans toutes les dimensions, avec une légère prédominance de la qualité de l'information et de la fiabilité, reflétant un cours universitaire rigoureux et bien structuré.

Fiabilité 9/10