Lec 25: Transformers - II

Lec 25: Transformers - II

🎙 Prof. Arijit Sur 👥 228K 📅 31 août 2026 ⏱ 54 min 👁 2 📄 cours magistral 🧭 2026-08-31
Disponible en : Français (actuel) English

Mots-clés

attentionself-attentionquerykeyvalue

Résumé

Ce cours, deuxième partie sur les transformers, détaille le mécanisme d’attention tel qu’utilisé dans l’architecture transformer, en partant du cas de la génération de légendes d’images. L’enseignant explique d’abord comment l’attention est calculée : à partir de vecteurs de requête (query), de clé (key) et de valeur (value), on calcule des scores d’alignement, normalisés par softmax, puis on effectue une somme pondérée des valeurs pour obtenir un vecteur de contexte. Il introduit ensuite l’auto-attention (self-attention), où les trois vecteurs sont dérivés de la même séquence via des transformations linéaires, permettant à chaque élément de la séquence de pondérer l’importance des autres. Deux variantes sont présentées : l’auto-attention masquée (masked self-attention), utilisée dans les modèles autorégressifs comme GPT, qui empêche de regarder les tokens futurs, et l’auto-attention multi-têtes (multi-head self-attention), qui permet de capturer différentes relations. Le cours insiste sur l’importance de la normalisation par la racine carrée de la dimension pour éviter des distributions de softmax trop extrêmes, et sur la séparation des représentations via des couches fully connected pour augmenter la flexibilité du modèle.

175 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le cours fournit une explication détaillée et progressive du mécanisme d’attention, avec des schémas et des exemples concrets. L’argumentation est solide, chaque concept est introduit et justifié, notamment la normalisation par racine de d pour éviter l’instabilité de l’apprentissage. La distinction entre attention générale et auto-attention est clairement expliquée, avec des schémas illustratifs. La présentation est pédagogique, adaptée à un public étudiant en informatique.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : le contenu est cohérent avec les fondements des transformers (comme décrits dans l’article ‘Attention is All You Need’). Les sources ne sont pas citées dans la vidéo, mais le cours s’appuie sur des connaissances établies. Le titre est parfaitement adapté au contenu. La description fournit des liens vers le cours NPTEL et la playlist, ce qui permet de contextualiser. Aucune source externe n’est mentionnée dans la vidéo.

159 mots

Adéquation titre / contenu

Le titre 'Transformers - II' correspond exactement au contenu : suite du cours sur les transformers, avec focus sur l'attention, l'auto-attention et ses variantes.

Qualité & fiabilité

8/10

Cours magistral universitaire (NPTEL IIT Guwahati) par un professeur en informatique. Contenu théorique rigoureux, pédagogique, sans erreur flagrante. La transcription est parfois approximative mais le fond est solide.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une explication pédagogique et détaillée du mécanisme d’attention et de ses variantes, en s’appuyant sur des schémas et des exemples. Il est particulièrement utile pour les étudiants qui découvrent les transformers, car il décompose chaque étape du calcul. L’accent mis sur la normalisation par racine de d et sur la séparation des représentations Q, K, V est un point fort.

Pour aller plus loin :

106 mots

Profil radar

Le profil radar montre un niveau élevé sur tous les axes, avec une légère prédominance de la quantité d'information et du niveau technique. Cela indique un contenu dense et rigoureux, adapté à un public déjà initié.

Fiabilité 8/10