CLJC Session 22 - Attention Prompting on Image for Large Vision-Language Models

CLJC Session 22 - Attention Prompting on Image for Large Vision-Language Models

🎙 Robust and Interpretable Machine Learning Lab 👥 1K 📅 18 novembre 2025 ⏱ 23 min 👁 14 📄 revue de littérature 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

Attention PromptingLVLMVisual PromptingCLIPLLaVA

Résumé

Cette session de journal club présente l’article ‘Attention Prompting on Image for Large Vision-Language Models’ (arXiv:2409.17143). L’orateur commence par rappeler le contexte des modèles de langage et de vision (LVLM) et la notion de prompting textuel, puis introduit le visual prompting, qui consiste à ajouter des annotations sur l’image d’entrée pour guider le modèle. Il souligne que les méthodes existantes (bounding boxes, segmentation) sont souvent spécifiques à une tâche et ne sont pas alignées avec la requête textuelle. L’article propose une méthode appelée Attention Prompting on Image (API) qui superpose une carte d’attention, calculée à partir de la similarité entre les tokens textuels et les patches d’image, sur l’image d’entrée. Cette carte est dérivée soit d’un modèle externe comme CLIP, soit du LVLM lui-même (LLaVA). L’orateur détaille les deux variantes, discute des choix d’implémentation (utilisation des dernières couches, agrégation des têtes d’attention) et présente les résultats expérimentaux : améliorations modestes mais constantes sur plusieurs benchmarks (MM-Vet, LLaVA-Wild). Il note que le gain est marginal et que la méthode est sensible au choix des hyperparamètres. Il mentionne également des ablations sur le choix des couches et des modèles. Enfin, il discute des limites, notamment la dépendance à un modèle auxiliaire pour les modèles propriétaires, et suggère des pistes d’amélioration, comme l’utilisation de DINO. La présentation se termine par une suggestion de travail connexe sur les ‘perception tokens’.

226 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est correcte : l’orateur explique clairement l’idée principale de l’article, les motivations, la méthode et les résultats. Il apporte une critique constructive en notant que les gains sont marginaux et que la méthode n’est pas toujours optimale. L’argumentation est solide, basée sur les résultats présentés dans l’article, mais l’orateur émet des réserves personnelles sur l’efficacité réelle. Il souligne que la méthode est training-free et simple, mais qu’elle nécessite un modèle auxiliaire pour les LVLM propriétaires. La discussion est honnête et nuancée, ce qui renforce la crédibilité de l’exposé.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite l’article source (arXiv) et le site du présentateur. Il ne mentionne pas d’autres sources, mais l’article est bien identifié. L’adéquation titre/contenu est parfaite. La présentation est fidèle à l’article, avec quelques simplifications. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

162 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : présentation de l'article 'Attention Prompting on Image for Large Vision-Language Models'.

Qualité & fiabilité

7/10

Présentation claire et structurée d'un article de recherche, avec discussion critique des résultats et des limites. L'exposé est informel mais s'appuie sur des références académiques (arXiv). Quelques imprécisions dans les explications techniques.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

L’apport original de cette vidéo est de fournir une explication pédagogique et critique de l’article sur l’Attention Prompting on Image (API). L’orateur clarifie les concepts, discute des choix d’implémentation et évalue honnêtement les résultats. Il propose également des pistes de recherche futures, comme l’utilisation de DINO pour améliorer la carte d’attention.

Pour aller plus loin :

  • Visual Prompting — Article Wikipédia sur le prompting, incluant le visual prompting.
  • CLIP — Article original de CLIP, modèle utilisé pour extraire les cartes d’attention.
  • LLaVA — Article original de LLaVA, modèle LVLM utilisé dans l’article.
  • DINO — Article sur DINO, un modèle d’auto-supervision pour la vision, suggéré comme amélioration potentielle.

107 mots

Profil radar

Le profil radar montre une performance équilibrée sur les quatre axes, avec une légère supériorité en fiabilité et en niveau technique, reflétant une présentation solide mais sans approfondissement extrême.

Fiabilité 7/10