CLSP Summer Program: Plenary Speaker

CLSP Summer Program: Plenary Speaker

🎙 Raman Arora 👥 4K 📅 11 juillet 2026 ⏱ 91 min 👁 161 📄 conférence 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

audio language modelsmultimodalspeechdiarizationcurriculum training

Résumé

Cette conférence plénière du programme d’été du CLSP (Center for Language and Speech Processing) de l’université Johns Hopkins est donnée par Raman Arora, professeur à l’université du Maryland. Il présente une ligne de recherche sur les grands modèles de langage audio (LALM), qui visent à traiter l’audio de manière générale, au-delà de la seule reconnaissance vocale. Il retrace l’évolution de ses travaux, depuis les modèles spécialisés comme Whisper jusqu’aux modèles multimodaux de la famille Audio Flamingo, développés en collaboration avec Nvidia. Il détaille l’architecture de ces modèles, qui intègrent un encodeur audio (basé sur Whisper) et un LLM, reliés par un adaptateur, et souligne l’importance du curriculum training pour entraîner progressivement ces modèles. Il présente les benchmarks associés (MMAU, MMAU-Pro) et les performances de ses modèles, qui surpassent les autres modèles open-source mais restent inférieurs à Gemini de Google. Il aborde également les défis de la diarisation (identification des locuteurs) et de l’horodatage, qui ont conduit au développement d’Audio Flamingo Next. Enfin, il mentionne des applications concrètes, comme l’analyse musicale (Music Flamingo) et la compréhension de scènes audio-visuelles (Audio-Visual Flamingo).

180 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le conférencier présente des travaux originaux, publiés et open-source, avec des détails techniques précis sur l’architecture et l’entraînement. L’argumentation est solide, appuyée sur des benchmarks et des comparaisons avec d’autres modèles. Il reconnaît les limites de ses modèles, notamment en diarisation, et discute des choix de conception. La présentation est structurée et progressive, facilitant la compréhension.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : les travaux sont publiés et les modèles sont open-source, ce qui permet une vérification. Les sources citées sont principalement les propres publications de l’orateur et de ses collaborateurs, ainsi que des références à des modèles comme Whisper et Gemini. Le titre est générique mais adéquat, car il s’agit d’une conférence plénière. Aucun commentaire n’est fourni, donc aucune analyse des tendances du public n’est possible.

148 mots

Adéquation titre / contenu

Le titre est générique mais correspond au contenu : il s'agit bien d'une conférence plénière dans le cadre du programme d'été du CLSP.

Qualité & fiabilité

8/10

Conférence académique par un chercheur reconnu, présentant des travaux publiés et des modèles open-source, avec des références explicites à des benchmarks et à des collaborations industrielles. Le discours est nuancé et admet les limites des modèles.

Moments clés

Sources citées

  • Audio Flamingo 2 — Modèle open-source présenté comme le premier de la collaboration avec Nvidia.
  • Audio Flamingo 3 — Modèle le plus capable de la famille, entraîné sur 50 millions de données.
  • MMAU — Benchmark pour l'évaluation des modèles audio-langage.
  • MMAU-Pro — Benchmark plus avancé, présenté lors d'une précédente édition du JHU CLSP.
  • Whisper — Modèle de reconnaissance vocale utilisé comme base pour l'encodeur audio.

Sources concordantes

  • Audio Flamingo 2 — Modèle open-source présenté comme le premier de la collaboration avec Nvidia.
  • Audio Flamingo 3 — Modèle le plus capable de la famille, entraîné sur 50 millions de données.
  • MMAU — Benchmark pour l'évaluation des modèles audio-langage.
  • MMAU-Pro — Benchmark plus avancé, présenté lors d'une précédente édition du JHU CLSP.

Sources discordantes

  • Gemini — Le conférencier mentionne que Gemini de Google surpasse ses modèles sur certains benchmarks, notamment grâce à l'accès aux données de YouTube.

Apport & nouveautés

Cette conférence apporte un éclairage sur les avancées récentes dans le domaine des modèles de langage audio, en présentant une famille de modèles open-source (Audio Flamingo) qui dépassent les approches spécialisées. L’originalité réside dans l’architecture modulaire et le curriculum training, ainsi que dans la création de benchmarks dédiés (MMAU, MMAU-Pro). L’orateur discute également des défis de la diarisation et de l’horodatage, et propose des pistes pour les résoudre.

Pour aller plus loin :

  • Audio Flamingo 2 — Modèle open-source de référence pour l’audio-langage.
  • Audio Flamingo 3 — Version améliorée avec de meilleures performances.
  • MMAU — Benchmark pour évaluer les modèles audio-langage.
  • Whisper — Modèle de reconnaissance vocale utilisé comme base.
  • Large Audio Language Models — Article de référence sur les modèles audio-langage.

122 mots

Profil radar

Le profil radar montre une performance équilibrée, avec des scores élevés en quantité et qualité d'information, ainsi qu'en fiabilité. Le niveau technique est également bon, reflétant la nature spécialisée de la conférence.

Fiabilité 8/10