Generative AI L27: Supervised fine tuning, full fine tuning, parameter-efficient fine tuning (PEFT)

Generative AI L27: Supervised fine tuning, full fine tuning, parameter-efficient fine tuning (PEFT)

🎙 Agha Ali Raza 👥 3K 📅 23 mai 2026 ⏱ 58 min 👁 44 📄 cours magistral 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

fine-tuningsupervisedPEFTLoRAalignment

Résumé

Ce cours magistral de la série ‘Foundations of Generative AI’ (CS5302/EE519) à LUMS, présenté par Agha Ali Raza, aborde en profondeur le fine-tuning supervisé (SFT), le fine-tuning complet et le fine-tuning efficace en paramètres (PEFT). Le professeur commence par expliquer le paradigme du SFT : à partir d’un modèle pré-entraîné, on collecte un jeu de données de haute qualité composé de paires instruction-réponse. Il insiste sur l’importance de la qualité, de la diversité et de la cohérence de ces données, et introduit le concept de ‘instruction masking’ ou ‘completion-only training’, où la perte n’est calculée que sur les réponses, pas sur les instructions. Il compare ensuite les différentes stratégies : le fine-tuning complet (mise à jour de tous les paramètres) et le PEFT, qui ne met à jour qu’un petit nombre de paramètres, avec une attention particulière sur LoRA (Low-Rank Adaptation). Le cours souligne les avantages du SFT (amélioration immédiate de la capacité à suivre les instructions, petits jeux de données suffisants) et ses limites (imitation plutôt que compréhension, difficulté à gérer les réponses subjectives, risque de surapprentissage). Il prépare le terrain pour les méthodes d’alignement basées sur les préférences humaines, comme le RLHF.

194 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le cours fournit une explication claire et structurée des concepts fondamentaux du fine-tuning, avec des exemples concrets et des analogies pédagogiques (comme l’adaptation culturelle). L’argumentation est solide, s’appuyant sur des principes établis et des observations empiriques (taille des jeux de données, nombre d’époques). Le professeur soulève des questions pertinentes (pourquoi SFT est supervisé, différence avec le pré-entraînement) et y répond de manière logique. Il introduit également des notions avancées comme le catastrophique forgetting et la calibration des préférences, qui sont cruciales pour comprendre les limites du SFT.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : le contenu est conforme aux connaissances académiques actuelles sur le fine-tuning. Cependant, la vidéo ne cite pas explicitement de sources ou de références bibliographiques, bien que le professeur mentionne des travaux comme le papier sur LoRA (que les étudiants sont censés lire). Les liens fournis dans la description (site du cours et playlist) sont des ressources complémentaires, mais ne constituent pas des sources primaires. L’adéquation entre le titre et le contenu est parfaite : les trois sections correspondent exactement aux trois méthodes annoncées.

198 mots

Adéquation titre / contenu

Le titre décrit précisément le contenu : les trois sections correspondent aux trois méthodes de fine-tuning annoncées.

Qualité & fiabilité

8/10

Cours universitaire structuré, présenté par un professeur, avec des explications pédagogiques claires. Les concepts sont bien établis dans la littérature (SFT, PEFT, LoRA). Pas de références explicites à des sources externes dans la vidéo, mais le contenu est conforme aux connaissances académiques.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

Ce cours apporte une explication pédagogique claire et structurée des différentes stratégies de fine-tuning, en mettant l’accent sur les compromis entre coût computationnel et performance. Il introduit des concepts clés comme l’instruction masking et la distinction entre imitation et compréhension, qui sont essentiels pour comprendre les limites du SFT et la nécessité d’approches plus avancées comme le RLHF. L’analogie avec l’adaptation culturelle est une contribution originale qui aide à conceptualiser le fine-tuning.

Pour aller plus loin :

122 mots

Profil radar

Le profil radar montre un bon équilibre entre la quantité et la qualité de l'information, avec un niveau technique élevé. La fiabilité est solide, mais la note globale est légèrement inférieure en raison du manque de sources explicites et de la nature pédagogique plutôt que de recherche originale.

Fiabilité 8/10