Trustworthy Medical AI Addressing Reliability & Explainability in Vision Language Models for Health

Trustworthy Medical AI Addressing Reliability & Explainability in Vision Language Models for Health

🎙 Huazhu Fu 👥 824 📅 5 novembre 2025 ⏱ 32 min 👁 50 📄 revue d'actualité 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

fiabilitéexplicabilitéincertitudehallucinationgrounding

Résumé

Huazhu Fu, chercheur principal à A*STAR (Singapour), présente lors du symposium ADIA Lab 2025 ses travaux sur la fiabilité et l’explicabilité des modèles de vision-langage (VLM) pour la santé. Il commence par rappeler les progrès récents de l’IA en imagerie médicale, citant des modèles fondateurs comme RETFound et PLIP, mais souligne le fossé entre les performances en laboratoire et le déploiement clinique. Pour la fiabilité, il propose d’utiliser l’estimation d’incertitude : au lieu d’une prédiction unique, le modèle génère un ensemble de prédictions dont la variance indique le niveau de confiance. Cela permet de détecter les données hors distribution (maladies rares, images de mauvaise qualité) et de déclencher une alerte pour un examen humain. Il montre que cette approche améliore la précision et permet de filtrer les résultats non fiables, atteignant plus de 90% de précision sur des données externes. Il étend cette méthode aux modèles fondateurs et aux VLM pour réduire les hallucinations, en combinant transformations visuelles et perturbations sémantiques. Pour l’explicabilité, il introduit le concept de ‘grounding’ médical : associer chaque phrase d’un rapport à une région de l’image. Il présente sa méthode ‘GMAI’ et un nouveau jeu de données ‘GMAI-X’ avec des annotations de boîtes englobantes pour plusieurs types de questions. Il montre que cette approche améliore la précision et permet un raisonnement visuel en chaîne (visual chain-of-thought). En conclusion, il propose une collaboration homme-IA où l’incertitude guide la délégation et le grounding rend le raisonnement transparent.

240 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’orateur présente des résultats concrets de ses recherches, avec des chiffres précis (précisions, comparaisons avec GPT-4, etc.). Il explique clairement les problèmes (hallucinations, données hors distribution) et propose des solutions originales (estimation d’incertitude, grounding). L’argumentation est solide : il justifie chaque étape, compare avec des méthodes existantes, et discute des limites. Il s’appuie sur des travaux publiés et des évaluations sur des jeux de données réels. La présentation est structurée et pédagogique, même si le niveau technique est élevé.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des publications majeures (RETFound dans Nature, PLIP, etc.) et présente ses propres travaux avec des résultats expérimentaux. Cependant, il ne donne pas de références précises (auteurs, années, journaux) pour toutes les affirmations, et certaines méthodes sont décrites de manière succincte. La qualité des sources est bonne, mais on pourrait souhaiter plus de détails bibliographiques. L’adéquation titre/contenu est parfaite : le titre reflète exactement le sujet traité. Aucun commentaire n’est fourni, donc aucune tendance du public n’est analysée.

186 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : la présentation traite spécifiquement de la fiabilité et de l'explicabilité des modèles de vision-langage pour la santé.

Qualité & fiabilité

8/10

Présentation par un chercheur reconnu (A*STAR, top 2% mondial) de travaux publiés dans des revues à comité de lecture. Les méthodes sont décrites avec précision, les résultats chiffrés sont fournis, et les limites sont évoquées. Le niveau de détail technique est élevé, mais certaines affirmations manquent de références explicites dans la vidéo.

Moments clés

Sources citées

Sources concordantes

  • RETFound - Nature — Article cité par l'orateur comme exemple de modèle fondateur en santé.
  • PLIP - arXiv — Article cité par l'orateur comme exemple d'utilisation de données publiques pour entraîner un modèle CLIP.

Apport & nouveautés

L’apport original de cette présentation réside dans la combinaison de deux approches complémentaires pour rendre les VLM médicaux plus fiables et plus explicables : l’estimation d’incertitude pour la fiabilité et le grounding visuel pour l’explicabilité. L’orateur propose des méthodes concrètes, validées sur des jeux de données réels, et introduit un nouveau jeu de données (GMAI-X) avec des annotations de boîtes englobantes pour le grounding. Il étend également le concept de chaîne de raisonnement au domaine visuel, ce qui constitue une avancée notable.

Pour aller plus loin :

  • Vision-Language Models — Article Wikipédia sur les modèles vision-langage, pour comprendre les bases.
  • Uncertainty quantification — Article Wikipédia sur la quantification de l’incertitude, concept clé de la méthode proposée.
  • Explainable artificial intelligence — Article Wikipédia sur l’IA explicable, pour contextualiser l’approche de grounding.
  • RETFound — Article Nature sur le modèle fondateur pour l’ophtalmologie, cité dans la vidéo.
  • PLIP — Article arXiv sur le modèle PLIP, également cité.

154 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés sur les quatre axes, indiquant une présentation dense en informations, techniquement solide, fiable et bien sourcée. La légère prédominance de la quantité d'information et du niveau technique reflète le caractère spécialisé de l'exposé.

Fiabilité 8/10