Generative AI L5: Tokenization (Word piece, unigram tokenization), language related terminologies

Generative AI L5: Tokenization (Word piece, unigram tokenization), language related terminologies

🎙 Agha Ali Raza 👥 3K 📅 26 avril 2026 ⏱ 59 min 👁 151 📄 cours magistral 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

tokenizationword pieceunigramBPEEM algorithm

Résumé

Ce cours de la série ‘Foundations of Generative AI’ (LUMS) aborde en profondeur deux algorithmes de tokenisation : WordPiece et Unigram. Le professeur commence par rappeler les bases de WordPiece, en soulignant sa différence avec BPE (le score PMI). Il détaille l’algorithme avec un exemple complet sur un corpus de 11 mots, en montrant les étapes de calcul des scores et les fusions successives. Il explique ensuite la tokenisation à l’inférence (plus long préfixe) et les variantes d’implémentation (gestion des égalités). Il justifie pourquoi BPE reste plus utilisé que WordPiece malgré sa simplicité (coût computationnel, disponibilité des implémentations). La seconde partie est consacrée à l’algorithme Unigram, basé sur le principe de vraisemblance et l’algorithme EM. Le professeur présente l’idée de partir d’un vocabulaire large et de le réduire itérativement en minimisant la perte (negative log-likelihood). Il illustre avec l’exemple d’un mot segmenté de différentes manières. Enfin, il aborde brièvement les terminologies (langue, script, style), le traitement au niveau des octets, SentencePiece et l’efficacité de la tokenisation. Le cours est en anglais avec des explications en ourdou.

176 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée : le cours fournit une explication détaillée et pédagogique de deux algorithmes fondamentaux de tokenisation, avec des exemples chiffrés et des références aux papiers originaux. L’argumentation est solide : le professeur justifie les choix de conception (score PMI pour WordPiece, vraisemblance pour Unigram) et compare les approches de manière critique. Il explique pourquoi BPE est plus répandu malgré ses limites, en invoquant des raisons pratiques (coût, disponibilité) et non seulement théoriques. La démonstration de l’algorithme Unigram avec l’algorithme EM est claire et bien structurée.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est bonne : le cours s’appuie sur des références académiques (papers) et des implémentations de référence. Le professeur insiste sur les variantes d’implémentation et les choix de tie-breaking, ce qui montre une attention aux détails. Les sources citées incluent les slides et le site du cours, mais les papiers ne sont pas explicitement nommés dans la vidéo. L’adéquation titre/contenu est parfaite. Aucun commentaire n’est fourni, donc aucune analyse des tendances du public n’est possible.

182 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : la vidéo traite de la tokenisation (word piece, unigram) et des terminologies liées au langage.

Qualité & fiabilité

8/10

Cours universitaire structuré, s'appuyant sur des références académiques (papers) et des explications détaillées. La démarche pédagogique est rigoureuse, avec des exemples concrets et des mises en garde sur les variantes d'implémentation. La fiabilité est bonne, mais le contenu est essentiellement pédagogique et non une revue exhaustive de la littérature.

Chapitres

Sources citées

Sources concordantes

Apport & nouveautés

La vidéo apporte une explication pédagogique détaillée de deux algorithmes de tokenisation, avec des exemples concrets et des comparaisons. Elle met en lumière les compromis entre BPE, WordPiece et Unigram, et explique pourquoi BPE reste dominant malgré ses limitations. L’originalité réside dans la mise en perspective historique et pratique.

Pour aller plus loin :

  • WordPiece tokenization — Article Wikipédia sur WordPiece, utile pour comprendre le contexte.
  • Subword regularization — Article sur la régularisation par sous-mots, lié à l’algorithme Unigram.
  • SentencePiece — Implémentation de référence de SentencePiece, mentionnée dans la vidéo.
  • BPE (Byte Pair Encoding) — Article Wikipédia sur BPE, pour comparer avec WordPiece.

103 mots

Profil radar

Le profil radar montre un contenu équilibré avec une bonne quantité d'informations, une qualité élevée, un niveau technique soutenu et une fiabilité globale bonne. La vidéo est dense et technique, adaptée à un public étudiant avancé.

Fiabilité 8/10