Lec 1: CPU Architecture

Lec 1: CPU Architecture

🎙 Dr. Satyajit Das et Prof. Satyadhyan Chickerur 👥 226K 📅 9 juillet 2026 ⏱ 35 min 👁 2K 📄 cours magistral 🧭 2026-08-02
Disponible en : Français (actuel) English

Mots-clés

CPUarchitecturepipelinesupercalaireexécution dans le désordreprédiction de branchemémoire cachebande passanteFLOPSIA

Résumé

Ce premier cours du module ‘Applied Accelerated Artificial Intelligence’ de NPTEL IIT Guwahati introduit l’architecture des processeurs (CPU) dans le contexte des charges de travail en intelligence artificielle. L’objectif est de fournir les bases nécessaires pour comprendre les performances des systèmes d’IA. Le cours est structuré en cinq segments couvrant respectivement l’architecture CPU, la hiérarchie mémoire, les GPU et accélérateurs, les interconnexions et la pile logicielle. Cette première leçon se concentre sur l’architecture CPU. L’instructeur explique le pipeline classique en cinq étapes (fetch, decode, execute, memory, writeback), puis les techniques d’amélioration des performances : le superscalaire, l’exécution dans le désordre et la prédiction de branche. Il détaille la hiérarchie mémoire (L1, L2, L3) avec les latences typiques, et compare les spécifications de processeurs serveurs (AMD EPYC, Intel Xeon) en termes de cœurs, de cache et de bande passante mémoire. Il souligne que les CPU sont optimisées pour la latence et les tâches séquentielles, tandis que les GPU sont optimisées pour le débit et les calculs massivement parallèles comme les multiplications matricielles. Les métriques clés comme les FLOPS et la bande passante mémoire sont introduites, ainsi que le concept de ‘memory wall’. Le cours se termine en évoquant les niveaux de parallélisme (ILP, DLP) et le rôle du reorder buffer.

209 mots

Évaluation critique

Ce cours magistral, dispensé par des enseignants-chercheurs de l’IIT Guwahati, offre une introduction solide et structurée à l’architecture des CPU dans le contexte spécifique de l’IA. La valeur pédagogique est indéniable : les concepts fondamentaux (pipeline, superscalaire, exécution dans le désordre, prédiction de branche, hiérarchie mémoire) sont expliqués de manière claire et accessible, avec des schémas à l’appui. L’accent mis sur les métriques de performance (FLOPS, bande passante) et la comparaison CPU/GPU est particulièrement pertinent pour comprendre les enjeux de l’accélération matérielle en IA. La rigueur scientifique est bonne : les notions présentées sont conformes aux connaissances établies en architecture des ordinateurs, et les ordres de grandeur (latences, capacités) sont réalistes. Cependant, on peut regretter un manque de profondeur sur certains points : la discussion sur le ‘memory wall’ reste superficielle, et les implications pratiques pour l’optimisation des charges de travail IA ne sont qu’effleurées. Les sources ne sont pas citées explicitement dans la vidéo, mais le cours s’appuie sur des références académiques classiques. L’adéquation entre le titre et le contenu est parfaite. Dans l’ensemble, il s’agit d’un contenu fiable et utile pour un public ayant déjà des bases en informatique, mais qui ne révolutionne pas le sujet.

198 mots

Adéquation titre / contenu

Le titre est parfaitement adapté au contenu : il s'agit bien d'une introduction à l'architecture des CPU dans le contexte de l'IA.

Qualité & fiabilité

8/10

Cours universitaire de l'IIT Guwahati, présenté par des enseignants-chercheurs, contenu technique précis et structuré, s'appuyant sur des notions établies en architecture des processeurs.

Moments clés

Sources citées

Sources concordantes

  • Computer Architecture: A Quantitative Approach (John L. Hennessy, David A. Patterson) — Ouvrage de référence en architecture des ordinateurs, dont les concepts présentés dans la vidéo sont issus.

Apport & nouveautés

Cette vidéo apporte une introduction pédagogique claire à l’architecture des CPU, spécifiquement orientée vers les besoins des charges de travail en IA. Elle met en évidence les différences fondamentales entre CPU et GPU (latence vs débit) et introduit les métriques clés (FLOPS, bande passante) nécessaires à l’évaluation des performances. L’originalité réside dans la mise en perspective des concepts classiques d’architecture avec les exigences de l’IA moderne.

Pour aller plus loin :

110 mots

Profil radar

Le profil radar montre une bonne qualité d'information et une fiabilité élevée, avec un niveau technique intermédiaire. La quantité d'information est correcte mais pourrait être plus dense. La fiabilité globale est soutenue par la provenance académique.

Fiabilité 8/10