Lec 03. Approximation Theory

Lec 03. Approximation Theory

🎙 Jeremy Bernstein 👥 6.4M 📅 11 février 2026 ⏱ 82 min 👁 16K 📄 cours magistral 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

approximation universellethéorème de Barronfonctions Lipschitzprofondeur vs largeurMLP ReLU

Résumé

Ce cours du MIT (6.7960 Deep Learning, Fall 2024) explore la théorie de l’approximation de fonctions par des réseaux de neurones profonds (DNN). L’instructeur, Jeremy Bernstein, commence par poser la question de savoir s’il vaut mieux augmenter la largeur ou la profondeur d’un réseau, et souligne que la réponse n’est pas triviale. Il introduit ensuite le cadre général de l’apprentissage machine comme un puzzle à trois pièces : approximation, optimisation et généralisation. La vidéo se concentre sur la première pièce : l’approximation. Après avoir rappelé qu’un réseau à une couche ne peut pas séparer des données non linéairement séparables, il présente la fonction de Weierstrass comme exemple de fonction pathologique. Le cœur du cours est la démonstration d’un théorème d’approximation universelle pour les fonctions Lipschitz continues sur l’hypercube [0,1]^d. Bernstein définit les fonctions Lipschitz, généralise la notion aux fonctions multivariées, puis énonce le théorème : pour toute fonction L-Lipschitz, il existe un réseau ReLU à trois couches avec un certain nombre de neurones qui l’approxime avec une erreur L1 bornée par 2ε. La preuve repose sur une discrétisation de l’espace d’entrée et une construction explicite du réseau. Ensuite, il introduit le théorème de Barron, qui donne une borne sur le nombre de neurones nécessaires pour approximer une fonction avec une erreur donnée, en fonction de la norme de Barron. Il discute également de l’expressivité des réseaux profonds, montrant que la profondeur peut réduire exponentiellement le nombre de paramètres nécessaires pour certaines fonctions. Enfin, il conclut en reliant ces résultats à la pratique, soulignant que la théorie d’approximation ne suffit pas à guider les choix d’architecture, et que l’optimisation et la généralisation sont tout aussi importantes.

275 mots

Évaluation critique

Ce cours magistral de Jeremy Bernstein, professeur au MIT, offre une introduction rigoureuse et pédagogique à la théorie de l’approximation des fonctions par les réseaux de neurones. La valeur scientifique est indéniable : le contenu est mathématiquement solide, avec des définitions précises (fonctions Lipschitz, norme RMS), des énoncés de théorèmes (approximation universelle, théorème de Barron) et des esquisses de preuves. L’argumentation est claire et progressive, partant de questions intuitives (largeur vs profondeur) pour aboutir à des résultats formels. La rigueur scientifique est exemplaire : les hypothèses sont explicites (fonctions Lipschitz, hypercube), les erreurs sont définies (L1, L∞), et les limites de la théorie sont mentionnées (la théorie d’approximation ne résout pas le problème d’optimisation). Les sources sont de haute qualité : il s’agit d’un cours du MIT OpenCourseWare, avec des liens vers la page du cours et la playlist YouTube. L’adéquation titre/contenu est parfaite : le titre ‘Approximation Theory’ reflète exactement le sujet. Le seul bémol est que la vidéo ne fournit pas de références bibliographiques détaillées dans la description, mais les concepts sont bien ancrés dans la littérature (théorème de Barron, etc.). La qualité pédagogique est remarquable : l’instructeur interagit avec les étudiants, pose des questions, et clarifie les points de confusion. Le niveau technique est élevé, mais accessible à un public ayant des bases en mathématiques et en apprentissage automatique. En résumé, c’est une excellente ressource pour comprendre les fondements théoriques des réseaux de neurones, avec une note globale de 5 étoiles.

244 mots

Adéquation titre / contenu

Le titre est parfaitement adapté : la vidéo traite exclusivement de la théorie de l'approximation de fonctions par des réseaux de neurones.

Qualité & fiabilité

9/10

Cours magistral de niveau universitaire (MIT OpenCourseWare) dispensé par un chercheur en apprentissage automatique. Le contenu est rigoureux, structuré, et s'appuie sur des démonstrations mathématiques. Les sources sont institutionnelles (MIT OCW).

Moments clés

Sources citées

Sources concordantes

Références externes

Apport & nouveautés

Ce cours apporte une introduction claire et rigoureuse à la théorie de l’approximation des fonctions par les réseaux de neurones, en mettant l’accent sur les résultats fondamentaux comme le théorème d’approximation universelle et le théorème de Barron. Il propose une démonstration constructive pour les fonctions Lipschitz, ce qui est rare dans les cours d’introduction. L’accent mis sur la distinction entre approximation, optimisation et généralisation est précieux pour comprendre les limites de la théorie. La discussion sur la profondeur vs la largeur est éclairante, avec des exemples concrets.

Pour aller plus loin :

166 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés dans toutes les dimensions, reflétant une excellente qualité pédagogique et scientifique. La quantité d'information est dense, la qualité est rigoureuse, le niveau technique est avancé, et la fiabilité est maximale grâce à la provenance institutionnelle.

Fiabilité 9/10