2026 Conference on Physics and AI: Sogol Sanjaripour

2026 Conference on Physics and AI: Sogol Sanjaripour

🎙 Sogol Sanjaripour 👥 34K 📅 30 juin 2026 ⏱ 31 min 👁 139 📄 étude originale 🧭 2026-08-03
Disponible en : Français (actuel) English

Mots-clés

fondation modelstokenizationastronomietransformersbenchmark

Résumé

Cette présentation, donnée lors de la conférence PAI26 à Stanford, porte sur un benchmark pour les modèles de fondation scientifiques, intitulé ‘The Galaxy’s Guide to the Tokenizer’. L’oratrice, Sogol Sanjaripour, commence par contextualiser l’essor de l’IA et son application croissante en astronomie, où les données massives et multimodales (images, spectres, courbes de lumière) dépassent l’échelle humaine. Elle souligne que la physique fournit une vérité terrain unique pour évaluer ces modèles. Elle retrace l’évolution du machine learning en astronomie, des méthodes classiques (PCA, SOM) aux réseaux de neurones profonds, puis aux modèles de fondation. Elle explique le fonctionnement des modèles de fondation, basés sur des transformers, et l’importance de la tokenisation, c’est-à-dire la manière de découper les images en tokens. L’étude compare quatre stratégies de tokenisation (Aphine, AIM, JetFormer, VQVAE) au sein d’un même backbone transformer (AstroPT) de 89 millions de paramètres, entraîné sur 640 000 galaxies du DESI Legacy Survey. Les représentations latentes sont évaluées pour prédire des propriétés physiques (masse stellaire, taux de formation d’étoiles) et pour reconstruire les images. Les résultats montrent que VQVAE obtient les meilleures performances en prédiction de propriétés physiques, tandis que JetFormer excelle en reconstruction d’images. L’oratrice conclut que le choix du tokenizer influence ce que le modèle apprend et comment la connaissance est organisée, soulignant l’importance de cette étape pour les applications scientifiques.

220 mots

Évaluation critique

La présentation de Sogol Sanjaripour est une contribution solide et bien structurée à la problématique des modèles de fondation pour l’astronomie. L’approche méthodologique est rigoureuse : elle compare systématiquement quatre tokenizers dans un cadre contrôlé (même backbone, mêmes données), ce qui permet d’isoler l’effet de la tokenisation. L’utilisation de mesures physiques indépendantes (masse stellaire, taux de formation d’étoiles) comme vérité terrain est un point fort, car elle ancre l’évaluation dans des quantités astrophysiques réelles, renforçant la crédibilité des résultats. Les résultats sont présentés de manière claire, avec des métriques (R²) pour la prédiction et des exemples visuels pour la reconstruction. Cependant, quelques limites méritent d’être notées. Tout d’abord, la présentation ne détaille pas les hyperparamètres des tokenizers ni les protocoles d’entraînement, ce qui rend la reproduction difficile. Ensuite, l’évaluation se limite à deux types de tâches (prédiction de propriétés et reconstruction) ; il aurait été intéressant d’inclure d’autres tâches en aval comme la classification ou la génération. De plus, l’oratrice ne discute pas des biais potentiels dans les données (par exemple, la sélection des galaxies) ni de la généralisabilité à d’autres types d’objets astronomiques. Enfin, la conclusion selon laquelle VQVAE est le meilleur pour la prédiction et JetFormer pour la reconstruction est intéressante, mais elle mériterait une analyse plus approfondie des compromis entre ces deux objectifs. Malgré ces réserves, la présentation est de haute qualité, avec une argumentation claire et des sources fiables (Stanford, Harvard). L’adéquation entre le titre et le contenu est bonne, bien que le titre soit générique. Dans l’ensemble, cette étude constitue une avancée utile pour guider le choix des tokenizers dans les modèles de fondation scientifiques.

270 mots

Adéquation titre / contenu

Le titre est générique mais correspond au contenu : il s'agit bien d'une présentation lors de la conférence PAI26.

Qualité & fiabilité

8/10

Présentation d'une étude originale avec méthodologie claire, données réelles (640 000 galaxies du DESI Legacy Survey), comparaison systématique de quatre tokenizers, ancrage dans des mesures physiques indépendantes. Sources institutionnelles (Stanford, Harvard AstroAI). Quelques limites : pas de détails sur les métriques d'évaluation complètes, pas de discussion des limites de l'étude.

Moments clés

Sources citées

Sources concordantes

Apport & nouveautés

Cette étude apporte une comparaison systématique de quatre stratégies de tokenisation pour les modèles de fondation en astrophysique, dans un cadre unifié. Elle met en évidence que le choix du tokenizer influence significativement les performances sur les tâches de prédiction de propriétés physiques et de reconstruction d’images, avec un compromis entre les deux. Cela fournit des repères concrets pour la conception de futurs modèles de fondation scientifiques.

Pour aller plus loin :

  • JetFormer — Article original de Google DeepMind sur ce tokenizer basé sur les flots normalisants.
  • VQVAE — Article fondateur sur les autoencodeurs variationnels vectoriels quantifiés.
  • AstroPT — Modèle de fondation pour l’astronomie, utilisé comme backbone dans cette étude.
  • DESI Legacy Survey — Relevé astronomique fournissant les données utilisées.

120 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés dans toutes les dimensions (quantité, qualité, niveau technique, fiabilité), indiquant une présentation dense et rigoureuse, avec un niveau technique avancé adapté à un public de spécialistes.

Fiabilité 8/10