[ИАД, осень 2025] Методы глубокого обучения. Лекция 12: Multimodality, CLIP, BLIP, LLaVA

[ИАД, осень 2025] Методы глубокого обучения. Лекция 12: Multimodality, CLIP, BLIP, LLaVA

🎙 Machine Learning – Intelligent Systems 👥 8K 📅 9 décembre 2025 ⏱ 110 min 👁 167 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

multimodalCLIPBLIPLLaVAcontrastive learning

Résumé

Cette leçon de la série ‘Méthodes de deep learning’ (automne 2025) est consacrée à la multimodalité, en particulier à la liaison image-texte. L’enseignant commence par définir la multimodalité et son intérêt, en illustrant par des exemples concrets (classification de clips, diagnostic médical). Il explique ensuite pourquoi les grands modèles de langage (LLM) servent de base aux modèles multimodaux, avant de présenter l’architecture CLIP d’OpenAI : collecte de 400 millions de paires image-texte, apprentissage contrastif avec une fonction de perte InfoNCE, utilisation de grands batchs (32768) et de la température. Il détaille le fonctionnement de la perte contrastive, puis évoque brièvement les modèles BLIP et LLaVA, ainsi que les benchmarks pour évaluer les modèles vision-langage. La leçon se termine par une discussion sur les tendances actuelles et les limites des modèles multimodaux.

131 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’exposé couvre de manière claire et structurée les concepts fondamentaux de la multimodalité, en s’appuyant sur des architectures de référence (CLIP, BLIP, LLaVA). L’argumentation est solide, appuyée par des explications techniques précises (fonction de perte, mécanisme d’attention, projection dans un espace commun). L’enseignant répond aux questions des étudiants, ce qui enrichit la discussion. La progression pédagogique est logique, de la motivation à la présentation des modèles, puis à leur évaluation.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les explications sont conformes aux connaissances établies sur ces modèles. Cependant, aucune source externe n’est citée dans la vidéo, ce qui limite la vérifiabilité. Le titre est en adéquation avec le contenu, qui traite bien de la multimodalité et des modèles CLIP, BLIP et LLaVA. La description ne fournit pas de liens, donc aucune source n’est listée. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

170 mots

Adéquation titre / contenu

Le titre annonce une leçon sur la multimodalité et les modèles CLIP, BLIP, LLaVA ; le contenu couvre effectivement ces sujets, avec des explications détaillées et des exemples.

Qualité & fiabilité

8/10

Exposé structuré et pédagogique sur les modèles multimodaux, s'appuyant sur des architectures et des méthodes bien établies (CLIP, BLIP, LLaVA). Les explications sont techniquement précises, avec des détails sur les mécanismes d'apprentissage (contrastive learning, loss, batch size). Aucune source externe n'est citée, mais le contenu est conforme aux connaissances académiques actuelles.

Moments clés

Apport & nouveautés

Cette leçon apporte une synthèse pédagogique claire et structurée des modèles multimodaux, en expliquant les principes fondamentaux et en les reliant aux architectures modernes. Elle est utile pour les étudiants et les praticiens souhaitant comprendre les bases de la multimodalité.

Pour aller plus loin :

96 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés (quantité, qualité, fiabilité), avec un niveau technique légèrement inférieur, indiquant une bonne vulgarisation tout en restant précis.

Fiabilité 8/10