Lecture 9: Mini-Workshop: Automated Information Extraction from Electronic Medical Records, Aug 27, 11

Lecture 9: Mini-Workshop: Automated Information Extraction from Electronic Medical Records, Aug 27, 11

🎙 Helena Gómez Adorno 👥 4K 📅 28 août 2025 ⏱ 64 min 👁 101 📄 tutoriel 🧭 2026-08-13
Disponible en : Français (actuel) English

Mots-clés

extraction d'informationsentités cliniquesNLPdossiers médicaux électroniquesreconnaissance d'entités nommées

Résumé

Cette conférence, donnée par la Dre Helena Gómez Adorno dans le cadre d’une école d’été sur l’informatique médicale, présente les principes et les méthodes de l’extraction automatisée d’informations à partir de dossiers médicaux électroniques en espagnol. Elle commence par définir l’extraction d’informations comme un sous-domaine du traitement automatique du langage naturel (TAL) visant à transformer des textes non structurés en données structurées. Elle explique ensuite ce que sont les entités cliniques (maladies, médicaments, procédures, signes vitaux, etc.) et pourquoi leur identification est utile pour l’aide à la décision clinique, la surveillance épidémiologique, la recherche et le contrôle qualité. L’oratrice décrit un pipeline classique d’extraction : prétraitement (tokenisation), reconnaissance d’entités nommées, détection de négation et de certitude, puis normalisation des entités selon des schémas standard (CIM, SNOMED CT). Elle compare les approches par règles, par apprentissage automatique (avec des modèles comme BERT) et par grands modèles de langage (LLM), en soulignant les compromis entre coût, précision, interprétabilité et confidentialité. Elle présente ensuite un cas d’application réel : le traitement de plus de 71 000 notes cliniques de 30 hôpitaux de Mexico pendant la pandémie de COVID-19, avec un tableau de bord pour visualiser les signes vitaux, les comorbidités et les médicaments prescrits. Enfin, elle propose un tutoriel pratique sur Google Colab utilisant SpaCy pour construire un système de reconnaissance d’entités cliniques basé sur des règles, avec une démonstration de ses limites (par exemple, la détection de négation).

236 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : la conférence offre une vue d’ensemble claire et structurée des méthodes d’extraction d’informations cliniques, allant des approches traditionnelles aux modèles récents. L’argumentation est solide, appuyée par des exemples concrets et une application réelle. L’oratrice justifie le choix de l’apprentissage automatique par rapport aux règles en soulignant la difficulté de généraliser les règles à différents domaines cliniques et la variabilité des écritures médicales. Elle aborde également les limites des LLM, notamment les problèmes de confidentialité et de coût, ce qui renforce la crédibilité de l’exposé.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’oratrice cite des travaux de son laboratoire et mentionne des références dans les diapositives (non détaillées ici). Les sources ne sont pas toutes vérifiables à partir de la transcription, mais les travaux présentés semblent publiés dans des revues. L’adéquation entre le titre et le contenu est parfaite : il s’agit bien d’un mini-atelier sur l’extraction automatisée d’informations à partir de dossiers médicaux électroniques. Aucun commentaire n’est fourni, donc aucune analyse des tendances du public n’est possible.

188 mots

Adéquation titre / contenu

Le titre est précis et correspond exactement au contenu : un mini-atelier sur l'extraction automatisée d'informations à partir de dossiers médicaux électroniques.

Qualité & fiabilité

8/10

Exposé structuré par une chercheuse spécialiste du TAL médical, appuyé sur des travaux publiés et une application concrète (SEDESA). Les concepts sont présentés avec clarté et les limites des approches sont discutées. La démonstration pratique renforce la crédibilité.

Moments clés

Sources citées

  • Site de l'IIMAS-UNAM — Institution de l'oratrice, mentionnée dans la description de la vidéo.

Sources concordantes

  • Article sur l'extraction d'informations en TAL — Définition générale de l'extraction d'informations, cohérente avec le contenu.

Apport & nouveautés

Cette conférence apporte une perspective pratique sur l’extraction d’informations cliniques en espagnol, avec un cas d’application réel pendant la pandémie de COVID-19. Elle illustre les défis spécifiques des dossiers médicaux électroniques, comme la variabilité linguistique et les erreurs d’orthographe, et propose des solutions hybrides combinant règles et apprentissage automatique. L’accent mis sur la confidentialité et les coûts des LLM est pertinent.

Pour aller plus loin :

116 mots

Profil radar

Le profil radar montre une bonne maîtrise du sujet avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est légèrement inférieur, ce qui reflète une présentation accessible mais avec des aspects avancés.

Fiabilité 8/10