Day 2: Mohammad Yaqub - The Medical Multimodal Mind Building Foundation Models for Health

Day 2: Mohammad Yaqub - The Medical Multimodal Mind Building Foundation Models for Health

🎙 Mohammad Yaqub 👥 824 📅 5 novembre 2025 ⏱ 42 min 👁 103 📄 conférence 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

modèles de fondationmultimodalsantédiagnostic zéro-shotéchographie

Résumé

Dans cette conférence donnée lors du symposium ADIA Lab 2025, Mohammad Yaqub, professeur associé en vision par ordinateur à l’Université Mohamed bin Zayed d’Intelligence Artificielle (MBZUAI), présente le concept de « Medical Multimodal Mind » : des modèles de fondation capables de comprendre conjointement des images médicales et des textes cliniques. Il commence par expliquer l’évolution de l’IA médicale, passant d’approches monomodales à des modèles multimodaux qui imitent le raisonnement clinique. Il souligne l’importance de dépasser les solutions isolées pour intégrer plusieurs types de données (imagerie, dossiers de santé électroniques, données omiques). Il introduit ensuite la notion de diagnostic zéro-shot, où un modèle entraîné sur de grandes quantités de données peut répondre à des tâches non vues, mais il en souligne les limites. Deux projets de recherche sont détaillés : FetalCLIP, un modèle de fondation pour l’échographie fœtale, qui atteint une précision de 95% en classification de vues et de 88% en détection de cardiopathies congénitales, et un projet sur l’échocardiographie qui évalue les modèles de fondation existants pour la quantification de la fonction cardiaque, montrant leurs limites face à des données hors distribution. Yaqub conclut en discutant des défis et opportunités des modèles de fondation en médecine, insistant sur la nécessité de collaboration humain-IA et sur les questions de généralisation et d’équité.

213 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’orateur présente des résultats de recherche originaux, notamment FetalCLIP et une évaluation comparative de modèles de fondation en échocardiographie. L’argumentation est structurée et convaincante, s’appuyant sur des exemples concrets et des statistiques (prévalence des cardiopathies congénitales, taux de détection). Il adopte une posture critique envers les modèles de fondation, reconnaissant leurs limites, ce qui renforce la crédibilité. Toutefois, certains résultats sont préliminaires et non publiés, ce qui limite la portée des conclusions.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des travaux de son équipe et mentionne des modèles de référence (CLIP, modèles de Stanford). Cependant, les sources précises ne sont pas détaillées dans la vidéo, et le seul lien fourni est celui du symposium. L’adéquation titre-contenu est excellente, le titre reflétant parfaitement le sujet. Aucun commentaire n’est fourni, donc aucune analyse des tendances du public n’est possible.

160 mots

Adéquation titre / contenu

Le titre reflète bien le contenu : la présentation porte sur les modèles de fondation multimodaux pour la santé.

Qualité & fiabilité

7/10

Exposé d'un chercheur reconnu, présentant des travaux de recherche originaux et des résultats préliminaires, mais sans détails méthodologiques complets ni revue par les pairs pour tous les résultats.

Moments clés

Sources citées

Sources concordantes

  • ADIA Lab Symposium — Page officielle du symposium, confirmant la tenue de l'événement et la participation de l'orateur.

Apport & nouveautés

L’apport original de cette conférence réside dans la présentation de FetalCLIP, un modèle de fondation multimodal spécifique à l’échographie fœtale, et dans l’évaluation critique des modèles de fondation existants pour l’échocardiographie. L’orateur insiste sur la nécessité de dépasser les approches monomodales et de construire des modèles capables de raisonner sur des données hétérogènes, tout en reconnaissant les défis de généralisation et d’équité.

Pour aller plus loin :

  • CLIP (Contrastive Language-Image Pre-training) — Modèle fondateur de l’apprentissage contrastif image-texte, base de nombreux modèles multimodaux.
  • FetalCLIP — Article préliminaire sur le modèle présenté (URL hypothétique, à vérifier).
  • Modèles de fondation en imagerie médicale — Revue des défis et opportunités des modèles de fondation en santé.

113 mots

Profil radar

Le profil radar montre une bonne qualité d'information et une fiabilité correcte, mais un niveau technique modéré, adapté à un public généraliste. La quantité d'information est satisfaisante, mais la profondeur technique est limitée par le format de conférence.

Fiabilité 7/10