Generative AI L12: Neural network for next-word-prediction based on 3 context words, intro to RNN

Generative AI L12: Neural network for next-word-prediction based on 3 context words, intro to RNN

🎙 Agha Ali Raza 👥 3K 📅 15 mai 2026 ⏱ 29 min 👁 54 📄 cours magistral 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

next-word predictionfeedforward neural networkembeddingsfine-tuningRNN

Résumé

Ce cours de la série ‘Foundations of Generative AI’ (CS5302/EE519) à LUMS, présenté par Agha Ali Raza, se concentre sur la conception d’un réseau de neurones feedforward pour la prédiction du mot suivant à partir de trois mots de contexte. Le professeur commence par rappeler l’architecture de base, où les embeddings des trois mots sont concaténés en un vecteur de 900 dimensions, puis passent par une couche cachée avec activation non linéaire, et enfin une couche de sortie avec softmax pour obtenir une distribution de probabilité sur le vocabulaire. Il souligne l’importance de préserver l’ordre des mots, contrairement à des opérations de pooling comme la moyenne. Ensuite, il compare cette approche à word2vec (CBOW et skip-gram), notant les différences clés : ici on utilise la concaténation et une couche cachée non linéaire, tandis que word2vec utilise des opérations linéaires. Il aborde également la question de l’utilisation d’embeddings pré-entraînés : soit les garder figés (freezing), soit les affiner (fine-tuning), en introduisant le concept de ‘catastrophic forgetting’. Enfin, il expose les limitations des réseaux feedforward : taille d’entrée fixe, absence de partage de paramètres et absence de mémoire, ce qui motive l’introduction des réseaux de neurones récurrents (RNN) pour traiter les séquences de manière plus naturelle.

204 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur pédagogique certaine en décomposant étape par étape la construction d’un modèle de langage neuronal. L’argumentation est solide : l’auteur justifie chaque choix de conception (concaténation plutôt que pooling, activation non linéaire, etc.) et illustre les concepts avec des exemples concrets. Il met en évidence les problèmes pratiques comme la croissance de la dimensionnalité avec le nombre de mots de contexte et l’absence de partage de paramètres, ce qui prépare logiquement l’introduction des RNN. La discussion sur le freezing et le fine-tuning des embeddings est particulièrement pertinente et bien expliquée, avec une analogie avec la formation médicale pour clarifier le concept de ‘catastrophic forgetting’.

Rigueur scientifique, qualité des sources, adéquation du titre

Le cours est rigoureux sur le plan scientifique : les concepts sont présentés avec précision et les notations sont claires. Cependant, aucune source bibliographique n’est citée dans la vidéo, bien que la description fournisse des liens vers le site du cours et la playlist. Le titre est en adéquation avec le contenu, qui couvre effectivement la prédiction du mot suivant avec trois mots de contexte et introduit les RNN. La qualité des sources est donc indirecte, via le matériel de cours disponible en ligne.

207 mots

Adéquation titre / contenu

Le titre décrit précisément le contenu : la construction d'un réseau de neurones pour la prédiction du mot suivant à partir de 3 mots de contexte, suivi d'une introduction aux RNN.

Qualité & fiabilité

8/10

Cours universitaire de niveau master, structuré et pédagogique, avec des explications détaillées et des schémas. Les concepts sont présentés de manière rigoureuse, mais sans références bibliographiques explicites dans la vidéo.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

L’apport principal de cette vidéo est de fournir une explication détaillée et accessible de la construction d’un modèle de langage neuronal, en insistant sur les choix d’architecture et leurs implications. Elle clarifie des concepts souvent mal compris comme la différence entre pooling et concaténation, et introduit proprement la notion de fine-tuning et de freezing des embeddings. La transition vers les RNN est bien motivée par les limitations des réseaux feedforward.

Pour aller plus loin :

  • Word2vec — Article Wikipédia sur l’algorithme word2vec, pertinent pour comprendre les embeddings pré-entraînés.
  • Recurrent neural network — Article Wikipédia sur les réseaux de neurones récurrents, directement lié à l’introduction des RNN.
  • Catastrophic forgetting — Article Wikipédia sur l’interférence catastrophique, concept mentionné dans la vidéo.

119 mots

Profil radar

Le profil radar montre des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité, avec un niveau technique modéré. Cela indique une vidéo dense et fiable, mais qui reste accessible à un public ayant des bases en apprentissage automatique.

Fiabilité 8/10