Borjan Geshkovski

Borjan Geshkovski

🎙 Borjan Geshkovski 👥 4K 📅 3 mai 2026 ⏱ 33 min 👁 35 📄 exposé de recherche 🧭 2026-08-13
Disponible en : Français (actuel) English

Mots-clés

transformershomogénéisationEDSattentioninitialisation

Résumé

Borjan Geshkovski présente ses travaux récents sur l’homogénéisation des transformers, réalisés en collaboration avec Ugo Kubi et Philip Prior. L’objectif est de dériver une équation différentielle stochastique (EDS) limite pour la dynamique des tokens dans un transformer, lorsque le pas de temps (nombre de couches) tend vers zéro. En se plaçant à l’initialisation, avec des matrices de poids gaussiennes i.i.d., il montre que le bruit devient un bruit commun, et que la dérive se simplifie. Il obtient une EDS sur la sphère, avec un terme de projection. Il étudie ensuite le phénomène de sur-lissage (ou effondrement de rang) et propose des critères de choix des hyperparamètres (dimension, nombre de têtes, température) pour l’éviter. Il présente des résultats sur la dynamique des produits scalaires entre tokens, montrant une convergence vers des configurations ordonnées. L’exposé est technique, s’adressant à un public de spécialistes, et s’appuie sur des méthodes de calcul stochastique et d’analyse asymptotique.

152 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : l’exposé présente une approche originale pour analyser les transformers, en les reliant à des EDS homogénéisées. L’argumentation est solide, basée sur une dérivation heuristique claire, suivie d’énoncés de théorèmes. L’orateur justifie les choix de modélisation (par exemple, la suppression des MLP, l’attention non masquée) et explique les implications pratiques. La démarche est rigoureuse, même si les preuves ne sont pas détaillées dans la vidéo.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : l’orateur s’appuie sur des travaux antérieurs (mentionnés oralement) et sur des méthodes classiques de calcul stochastique. Les sources citées ne sont pas listées dans la description, mais les références à des travaux de stochastic modified equations sont évoquées. Le titre de la vidéo est très pauvre, ne reflétant pas le contenu scientifique. L’adéquation titre/contenu est donc faible, mais cela ne pénalise pas fortement la note globale.

158 mots

Adéquation titre / contenu

Le titre est très succinct, ne reflétant pas le contenu scientifique détaillé. Il s'agit probablement du nom du conférencier, ce qui est insuffisant pour décrire le sujet.

Qualité & fiabilité

8/10

Exposé scientifique rigoureux, s'appuyant sur une dérivation mathématique explicite et des résultats théoriques annoncés. Les preuves ne sont pas détaillées dans la vidéo, mais les références clés sont mentionnées. Le niveau de formalisme est élevé et la démarche est cohérente.

Moments clés

Sources citées

  • Homogenized transformers (article arXiv) — L'orateur mentionne que l'article est disponible sur arXiv, mais l'URL exacte n'est pas fournie dans la vidéo.

Sources concordantes

Apport & nouveautés

L’apport original est de proposer un cadre d’homogénéisation pour les transformers, permettant d’obtenir une EDS limite à l’initialisation. Ceci offre une nouvelle perspective pour analyser le comportement des transformers et guider le choix des hyperparamètres. L’étude du sur-lissage dans ce cadre est également novatrice.

Pour aller plus loin :

83 mots

Profil radar

Le profil radar montre un niveau technique très élevé, une bonne quantité et qualité d'information, mais une fiabilité globale légèrement inférieure en raison du manque de détails sur les preuves. La note globale est bonne, reflétant un contenu scientifique solide.

Fiabilité 8/10