Contributed Talks: “Visual Processing in Brains and Models I” - CCN 2025

Contributed Talks: “Visual Processing in Brains and Models I” - CCN 2025

🎙 Cognitive Computational Neuroscience 👥 4K 📅 8 octobre 2025 ⏱ 54 min 👁 144 📄 revue d'actualité 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

traitement visuelmodèles computationnelsIRMfinvariancefovéa

Résumé

Cette vidéo présente une session de présentations lors de la conférence CCN 2025 à Amsterdam, consacrée au traitement visuel dans les cerveaux et les modèles computationnels. Cinq intervenants exposent leurs travaux. Johannes Roth et Martin Hebart abordent la question de la couverture des stimuli visuels utilisés en neurosciences, proposant un vaste ensemble d’images naturelles (LAION-Natural) comme proxy du monde visuel. Ils montrent que les jeux de données existants (THINGS, NSD) ne couvrent qu’une partie de cet espace, et que la diversité des stimuli améliore la généralisation hors distribution. Haider Al-Tahan et al. étudient la robustesse des humains et des réseaux de neurones profonds aux transformations 3D d’objets. Ils constatent que les modèles à grande échelle atteignent des performances proches de l’humain pour certaines transformations, mais restent inférieurs pour d’autres, et que l’alignement avec les erreurs humaines est imparfait. Stephanie Fu et al. présentent un modèle intégrant l’échantillonnage et l’intégration fovéaux pour l’inférence de formes 3D, s’inspirant de la biologie. Keisuke Toyoda et al. utilisent l’apprentissage non supervisé contraint par le connectome pour révéler des représentations visuelles émergentes dans le lobe optique de la drosophile. Ariane Delrocq et al. explorent comment des règles de plasticité développementale facilitent l’apprentissage de représentations dans un modèle du flux ventral visuel. L’ensemble illustre la diversité des approches en neurosciences computationnelles pour comprendre la vision.

219 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

Les présentations apportent des contributions originales et des résultats quantitatifs. Roth et Hebart fournissent une analyse systématique de la couverture des stimuli, avec des implications pratiques pour la conception d’études futures. Al-Tahan et al. proposent une évaluation comparative rigoureuse de l’invariance, avec une bibliothèque publique. Fu et al. présentent un cadre novateur intégrant des mécanismes biologiques. Les arguments sont étayés par des données expérimentales et des simulations, avec des discussions critiques lors des questions. La solidité de l’argumentation est bonne, même si certaines conclusions restent préliminaires.

Rigueur scientifique, qualité des sources, adéquation du titre

Les intervenants citent des travaux antérieurs, notamment ceux du laboratoire Kamitani, et mentionnent des benchmarks comme MOCHI. La qualité des sources est élevée, avec des références à des publications académiques. Le titre est en adéquation avec le contenu. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

154 mots

Adéquation titre / contenu

Le titre reflète exactement le contenu : une session de présentations sur le traitement visuel dans les cerveaux et les modèles.

Qualité & fiabilité

8/10

Les présentations sont issues de chercheurs académiques, avec des méthodes expérimentales détaillées et des références à des travaux publiés. Le niveau de détail et la rigueur des protocoles suggèrent une fiabilité élevée, bien que les résultats soient préliminaires et non encore publiés.

Moments clés

Sources citées

  • LAION-2B — Utilisé comme source d'images naturelles pour l'étude de Roth et Hebart.
  • THINGS — Base de données d'images utilisée pour comparer la couverture des stimuli.
  • Natural Scenes Dataset (NSD) — Jeu de données d'IRMf utilisé pour les analyses de généralisation.
  • MOCHI benchmark — Benchmark présenté par Stephanie Fu pour l'inférence de formes 3D.

Sources concordantes

Apport & nouveautés

La vidéo présente plusieurs avancées : l’analyse de la couverture des stimuli visuels et son impact sur la généralisation, l’évaluation systématique de l’invariance aux transformations 3D, et l’intégration de mécanismes biologiques (fovéa, connectome) dans les modèles. Ces travaux ouvrent des perspectives pour améliorer la conception des expériences et des modèles.

Pour aller plus loin :

  • CLIP — Modèle utilisé comme proxy pour l’espace représentationnel.
  • Vision Transformer (ViT) — Architecture utilisée dans les modèles évalués.
  • Connectome de la drosophile — Données utilisées pour contraindre l’apprentissage non supervisé.

86 mots

Profil radar

Le profil radar montre des scores élevés et équilibrés, indiquant une vidéo dense en informations, techniquement solide et fiable, avec une bonne adéquation au titre.

Fiabilité 8/10