
BioML Seminar 4.4 - Shreshth Gandhi on Scaling Perturbation-Trained Single-Cell Foundation Models
Mots-clés
Résumé
176 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : l’orateur présente des résultats originaux sur un modèle de fondation unicellulaire à grande échelle, avec des détails concrets sur l’architecture, l’entraînement et les applications. L’argumentation est solide, appuyée par des comparaisons quantitatives avec des modèles de référence (SCGPT, Geneformer, scBERT) sur plusieurs tâches en aval. Les limites sont également évoquées, notamment la difficulté d’interprétation des embeddings et la performance dégradée en zero-shot. La présentation est technique et précise, avec des réponses aux questions du public qui clarifient les choix méthodologiques.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : l’orateur cite des ensembles de données publics (SCP, CCLE, DepMap, MSigDB) et des modèles antérieurs (SCGPT, Geneformer, scBERT, scVI). Cependant, certaines données (Tahoe-100M) sont propriétaires et non encore publiées, ce qui limite la vérifiabilité. Le titre est parfaitement adéquat au contenu. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.
164 mots
Adéquation titre / contenu
Le titre reflète exactement le contenu : présentation d'un modèle de fondation unicellulaire entraîné sur des données de perturbation.
Qualité & fiabilité
8/10
Présentation technique détaillée d'un modèle de fondation pour la génomique unicellulaire, avec des résultats quantitatifs et des comparaisons à des références établies. L'orateur est un expert reconnu (directeur ML chez Tahoe Bio, ancien de Deep Genomics). Les méthodes sont décrites avec précision, mais certaines données restent propriétaires et non publiées à ce jour.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et contexte : difficulté de cartographier expérimentalement toutes les combinaisons médicament-cellule.
- Présentation de Tahoe-100M : 100 millions de profils de perturbation sur 50 lignées cancéreuses et 1 200 composés.
- Architecture du modèle : transformer avec tokenisation des gènes et des valeurs d'expression, objectif de masquage, encodeur chimique.
- Ingénierie : optimisation du coût d'entraînement, kernels personnalisés en Triton, streaming des données.
- Application 1 : prédiction de scores de dépendance génique à partir de cribles CRISPR (DepMap).
- Application 2 : classification de gènes par appartenance à des voies (MSigDB).
- Application 3 : prédiction de réponses aux perturbations, comparaison few-shot vs zero-shot.
- Discussion sur les limites et les perspectives : vers une cellule virtuelle.
Sources citées
- Tahoe-x1 (article non publié) — Modèle présenté dans la vidéo, non encore publié.
- SCP (Single Cell Portal) — Source de données publiques mentionnée pour l'entraînement.
- CCLE (Cancer Cell Line Encyclopedia) — Données d'expression utilisées pour les embeddings de gènes.
- DepMap (Cancer Dependency Map) — Données de cribles CRISPR utilisées pour la prédiction de dépendance.
- MSigDB (Molecular Signatures Database) — Ensembles de gènes pour la classification fonctionnelle.
- scGPT — Modèle de référence mentionné pour comparaison.
- Geneformer — Modèle de référence mentionné pour comparaison.
- scBERT — Modèle de référence mentionné pour comparaison.
- scVI — Modèle de référence mentionné pour comparaison.
Sources concordantes
- scGPT — Modèle de référence dont l'architecture a inspiré Tahoe-x1, résultats comparables.
- Geneformer — Modèle de référence pour les embeddings de gènes, résultats comparables.
Sources discordantes
Apport & nouveautés
L’apport original de cette présentation est la mise à l’échelle d’un modèle de fondation unicellulaire à 3 milliards de paramètres, entraîné sur un corpus de perturbations sans précédent (250M cellules, dont 100M de profils de perturbation). L’accent est mis sur l’ingénierie pour réduire les coûts d’entraînement (45 000 $) et sur la démonstration que les embeddings appris surpassent les modèles existants sur des tâches en aval comme la prédiction de dépendance génique et la classification de voies. La discussion sur les défis du zero-shot et les leçons pratiques pour l’entraînement de grands modèles sur données unicellulaires constitue une contribution utile.
Pour aller plus loin :
- Single-cell RNA sequencing — Contexte sur les données unicellulaires.
- Foundation models in biology — Article de synthèse sur les modèles de fondation en biologie.
- scGPT — Modèle de référence pour la comparaison.
- Geneformer — Modèle de référence pour la comparaison.
- Virtual Cell — Concept de cellule virtuelle mentionné en conclusion.
155 mots
Profil radar
Le profil radar montre un niveau technique élevé (9/10) et une bonne quantité d'informations (8/10), mais une fiabilité globale légèrement inférieure (7/10) en raison du caractère non publié des données. La qualité de l'information est également élevée (8/10), indiquant une présentation dense et précise.