BioML Seminar 3.1 - Abhinav Adduri on Modeling cell perturbations with STATE

BioML Seminar 3.1 - Abhinav Adduri on Modeling cell perturbations with STATE

🎙 Abhinav Adduri 👥 14K 📅 30 octobre 2025 ⏱ 66 min 👁 207 📄 revue de littérature 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

STATEperturbationcellulestransformerARN-seq

Résumé

Abhinav Adduri présente STATE, un modèle de type transformer conçu pour prédire les effets de perturbations sur des populations de cellules. Le modèle traite des ensembles de cellules plutôt que des cellules individuelles, ce qui lui permet de gérer l’hétérogénéité cellulaire et le bruit technique. STATE est entraîné sur plus de 100 millions de cellules perturbées et améliore la discrimination des effets de plus de 30% par rapport aux méthodes existantes. Le modèle utilise une architecture à deux composants : un modèle d’embedding de cellules (STATE embedding) et un modèle de transition. L’embedding est appris sur 167 millions de cellules observationnelles, permettant une interpolation lisse entre états cellulaires. Le modèle de transition opère sur des ensembles de cellules appariées par covariables, réduisant la charge d’apprentissage. Les résultats montrent que STATE surpasse les approches de pseudobulk et les modèles de type MLP, et généralise les méthodes basées sur le transport optimal. Le modèle est open source et participe au Virtual Cell Challenge de l’Arc Institute. La présentation inclut des détails sur l’architecture, l’entraînement et les évaluations, ainsi que des discussions sur les défis de la modélisation cellulaire.

186 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le modèle STATE représente une avancée significative dans la prédiction des effets de perturbations cellulaires, avec des gains de performance notables. L’argumentation est solide, appuyée par des évaluations quantitatives et des comparaisons avec des méthodes existantes. L’orateur justifie les choix de conception (traitement par ensembles, attention multi-têtes) par des intuitions et des résultats empiriques. La discussion sur les limites (bruit, covariables non annotées) renforce la crédibilité.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des travaux antérieurs (ex. modèle de cellule bactérienne de 2012, AlphaFold) et mentionne des données réelles (Tahoe, 100 millions de cellules). Les sources sont principalement des références à des publications, mais la présentation ne fournit pas de liens directs. Le titre est adéquat et reflète le contenu. La qualité des sources est correcte, mais l’absence de citations explicites dans la description limite la vérification.

160 mots

Adéquation titre / contenu

Le titre est précis et correspond au contenu : présentation du modèle STATE pour la modélisation des perturbations cellulaires.

Qualité & fiabilité

8/10

Présentation d'un modèle de recherche publié, avec détails techniques et évaluations, par un chercheur du domaine. Les sources sont principalement des travaux cités, mais la présentation est claire et structurée.

Moments clés

Sources citées

  • Article sur le modèle de cellule bactérienne (2012) — Référence à un modèle de cellule bactérienne construit manuellement avec des équations différentielles.
  • AlphaFold — Exemple de succès du deep learning pour la prédiction de structures protéiques.
  • Tahoe Therapeutics — Entreprise ayant publié un jeu de données de 100 millions de cellules.
  • Arc Institute Virtual Cell Challenge — Compétition Kaggle pour prédire les effets de perturbations cellulaires.

Sources concordantes

  • Article sur les modèles de fondation en biologie — Les modèles de fondation comme STATE sont de plus en plus utilisés en biologie.

Apport & nouveautés

L’apport principal est le modèle STATE, qui traite les cellules en ensembles plutôt qu’individuellement, ce qui permet de mieux gérer le bruit et l’hétérogénéité. Il généralise les approches de pseudobulk et de transport optimal, et améliore significativement la prédiction des effets de perturbations. Le modèle est open source et participe à un challenge public.

Pour aller plus loin :

101 mots

Profil radar

Le profil radar montre des scores élevés dans toutes les dimensions, indiquant une présentation riche en informations, techniquement solide et fiable. La quantité et la qualité de l'information sont bonnes, avec un niveau technique élevé adapté à un public averti.

Fiabilité 8/10