BioML Seminar 4.4 - Shreshth Gandhi on Scaling Perturbation-Trained Single-Cell Foundation Models

BioML Seminar 4.4 - Shreshth Gandhi on Scaling Perturbation-Trained Single-Cell Foundation Models

🎙 Shreshth Gandhi 👥 14K 📅 26 juin 2026 ⏱ 61 min 👁 74 📄 étude originale 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

Tahoe-x1single-cellfoundation modelperturbationdrug response

Résumé

Cette présentation du séminaire BioML 4.4 par Shreshth Gandhi (Tahoe Bio) détaille le développement et l’évaluation de Tahoe-x1, une famille de modèles de fondation unicellulaires allant jusqu’à 3 milliards de paramètres, entraînés sur un corpus de 250 millions de cellules, dont Tahoe-100M, le plus grand jeu de données de perturbations unicellulaires à ce jour. L’orateur explique la méthodologie de collecte de données à haut débit (regroupement de 50 lignées cancéreuses et 1 200 composés), l’architecture du modèle (transformer avec tokenisation des gènes et des valeurs d’expression, objectif de masquage, intégration d’un encodeur chimique), et les optimisations d’ingénierie pour réduire les coûts d’entraînement (45 000 $ pour le modèle 3B). Il présente ensuite plusieurs applications : prédiction de scores de dépendance génique à partir de cribles CRISPR, classification de gènes par appartenance à des voies (MSigDB), et prédiction de réponses aux perturbations dans des contextes cellulaires non vus. Les résultats montrent que les embeddings de Tahoe-x1 surpassent les références (SCGPT, Geneformer, scBERT) sur ces tâches. L’orateur conclut sur les leçons apprises et la vision d’une cellule virtuelle.

176 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’orateur présente des résultats originaux sur un modèle de fondation unicellulaire à grande échelle, avec des détails concrets sur l’architecture, l’entraînement et les applications. L’argumentation est solide, appuyée par des comparaisons quantitatives avec des modèles de référence (SCGPT, Geneformer, scBERT) sur plusieurs tâches en aval. Les limites sont également évoquées, notamment la difficulté d’interprétation des embeddings et la performance dégradée en zero-shot. La présentation est technique et précise, avec des réponses aux questions du public qui clarifient les choix méthodologiques.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur cite des ensembles de données publics (SCP, CCLE, DepMap, MSigDB) et des modèles antérieurs (SCGPT, Geneformer, scBERT, scVI). Cependant, certaines données (Tahoe-100M) sont propriétaires et non encore publiées, ce qui limite la vérifiabilité. Le titre est parfaitement adéquat au contenu. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

164 mots

Adéquation titre / contenu

Le titre reflète exactement le contenu : présentation d'un modèle de fondation unicellulaire entraîné sur des données de perturbation.

Qualité & fiabilité

8/10

Présentation technique détaillée d'un modèle de fondation pour la génomique unicellulaire, avec des résultats quantitatifs et des comparaisons à des références établies. L'orateur est un expert reconnu (directeur ML chez Tahoe Bio, ancien de Deep Genomics). Les méthodes sont décrites avec précision, mais certaines données restent propriétaires et non publiées à ce jour.

Moments clés

Sources citées

Sources concordantes

  • scGPT — Modèle de référence dont l'architecture a inspiré Tahoe-x1, résultats comparables.
  • Geneformer — Modèle de référence pour les embeddings de gènes, résultats comparables.

Sources discordantes

Apport & nouveautés

L’apport original de cette présentation est la mise à l’échelle d’un modèle de fondation unicellulaire à 3 milliards de paramètres, entraîné sur un corpus de perturbations sans précédent (250M cellules, dont 100M de profils de perturbation). L’accent est mis sur l’ingénierie pour réduire les coûts d’entraînement (45 000 $) et sur la démonstration que les embeddings appris surpassent les modèles existants sur des tâches en aval comme la prédiction de dépendance génique et la classification de voies. La discussion sur les défis du zero-shot et les leçons pratiques pour l’entraînement de grands modèles sur données unicellulaires constitue une contribution utile.

Pour aller plus loin :

  • Single-cell RNA sequencing — Contexte sur les données unicellulaires.
  • Foundation models in biology — Article de synthèse sur les modèles de fondation en biologie.
  • scGPT — Modèle de référence pour la comparaison.
  • Geneformer — Modèle de référence pour la comparaison.
  • Virtual Cell — Concept de cellule virtuelle mentionné en conclusion.

155 mots

Profil radar

Le profil radar montre un niveau technique élevé (9/10) et une bonne quantité d'informations (8/10), mais une fiabilité globale légèrement inférieure (7/10) en raison du caractère non publié des données. La qualité de l'information est également élevée (8/10), indiquant une présentation dense et précise.

Fiabilité 7/10