[M2L 2025] 1.1 Introduction to Deep Learning and Transformers - Skanda Koppula

[M2L 2025] 1.1 Introduction to Deep Learning and Transformers - Skanda Koppula

🎙 Skanda Koppula 👥 3K 📅 10 novembre 2025 ⏱ 58 min 👁 420 📄 cours magistral 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

deep learningtransformersattentionperceptrongradient descent

Résumé

Cette vidéo est un cours d’introduction au deep learning et aux transformers, donné par Skanda Koppula lors de la summer school Mediterranean Machine Learning (M2L) 2025. L’orateur commence par contextualiser l’essor du deep learning, attribué à quatre facteurs : l’explosion des données, la puissance matérielle (GPU, TPU), les frameworks de deep learning (PyTorch, JAX) et l’invention de modèles expressifs comme le transformer. Il présente ensuite les briques fondamentales : le perceptron, les fonctions d’activation (ReLU, GELU, SwiGLU), les couches denses, les fonctions de perte et l’optimisation par descente de gradient. Il insiste sur l’importance de l’initialisation, du taux d’apprentissage et des optimiseurs modernes comme AdamW. La seconde partie est consacrée aux transformers, présentés comme l’architecture dominante, avec le mécanisme d’attention comme composant clé. L’orateur évoque également les étapes d’entraînement des grands modèles : pré-entraînement auto-supervisé, fine-tuning sur données humaines et RLHF. La vidéo inclut une session de questions-réponses où sont abordés des points comme l’alignement image-texte, la robustesse aux données bruitées, l’utilisation de SwiGLU et la détection du sur-apprentissage.

169 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un public ayant des bases en machine learning. L’orateur explique clairement les concepts fondamentaux, en les reliant à des exemples concrets et à des pratiques modernes. L’argumentation est solide, s’appuyant sur des références implicites à des travaux fondateurs (Attention is All You Need, etc.) et sur une expérience pratique. La progression pédagogique est logique, des perceptrons aux transformers, et les réponses aux questions montrent une maîtrise du sujet.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les concepts sont présentés avec précision, et l’orateur distingue clairement les faits établis des opinions personnelles. Les sources ne sont pas citées explicitement dans la vidéo, mais les références aux papiers fondateurs sont implicites. Le titre est en adéquation avec le contenu. Aucun commentaire n’est fourni, donc aucune analyse des tendances du public n’est possible.

151 mots

Adéquation titre / contenu

Le titre annonce une introduction au deep learning et aux transformers, ce que la vidéo délivre fidèlement.

Qualité & fiabilité

8/10

Exposé pédagogique structuré par un chercheur, couvrant les fondamentaux du deep learning et des transformers. Les concepts sont présentés avec précision et les références aux travaux fondateurs (Attention is All You Need, etc.) sont implicites mais correctes. Quelques simplifications inhérentes au format de cours, mais sans erreur majeure.

Moments clés

Apport & nouveautés

Cette vidéo apporte une introduction claire et structurée aux concepts fondamentaux du deep learning et des transformers, adaptée à un public de summer school. Elle se distingue par une mise en perspective historique et une insistance sur les aspects pratiques (optimiseurs, initialisation, pipelines modernes).

Pour aller plus loin :

110 mots

Profil radar

Le profil radar montre un contenu équilibré, avec des scores élevés en quantité et qualité d'information, un niveau technique soutenu et une fiabilité globale bonne. Cela reflète un cours introductif solide, bien structuré et fiable.

Fiabilité 8/10