[ИАД, осень 2025] Методы глубокого обучение. Лекция 6: Image Classification

[ИАД, осень 2025] Методы глубокого обучение. Лекция 6: Image Classification

🎙 Danya Dorin 👥 8K 📅 14 octobre 2025 ⏱ 106 min 👁 110 📄 cours magistral 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

SIFTAlexNetVGGResNetVision Transformer

Résumé

Cette sixième leçon du cours de deep learning, donnée par Danya Dorin, étudiant en master, se concentre sur la classification d’images. Le cours commence par une introduction aux trois tâches principales de la vision par ordinateur : classification, détection et segmentation. Ensuite, l’enseignant présente l’algorithme SIFT (Scale-Invariant Feature Transform), une méthode classique de détection et de description de points d’intérêt invariants à l’échelle, basée sur des différences de gaussiennes et des histogrammes de gradients. Il explique comment ces descripteurs peuvent être utilisés pour la classification via un sac de mots visuels. La seconde partie de la leçon est consacrée aux architectures de réseaux de neurones convolutifs (CNN) qui ont marqué l’histoire : AlexNet, VGG, ResNet, Inception, Xception, MobileNet et EfficientNet. Pour chaque architecture, il détaille les innovations clés, comme l’utilisation de ReLU, les blocs résiduels, les convolutions en profondeur séparables, et les facteurs d’échelle. Enfin, il introduit le Vision Transformer (ViT), qui applique le mécanisme d’attention aux images en les découpant en patches. Le cours se termine par une comparaison des performances et des compromis entre ces architectures.

178 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour un cours universitaire : l’enseignant fournit une vue d’ensemble historique et technique des méthodes de classification d’images, avec des explications intuitives et des schémas. L’argumentation est solide, chaque architecture étant présentée avec ses motivations et ses innovations. Les explications sont progressives, partant des bases (SIFT) pour aboutir aux modèles modernes (ViT). Cependant, certaines parties pourraient être plus approfondies, et le cours reste une introduction.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est correcte : l’enseignant cite les travaux fondateurs (Lowe, Krizhevsky, He, etc.) et mentionne des références sur les slides. Cependant, les sources ne sont pas systématiquement détaillées dans la vidéo, et l’absence de bibliographie formelle limite la vérifiabilité. Le titre est adéquat, mais le contenu est plus large que la simple classification, incluant des aspects de détection et de segmentation en introduction.

151 mots

Adéquation titre / contenu

Le titre correspond bien au contenu : il s'agit d'une leçon sur les méthodes de classification d'images dans le cadre d'un cours de deep learning.

Qualité & fiabilité

7/10

Cours universitaire structuré, présenté par un étudiant en master, avec des explications claires et des références historiques. Les informations sont globalement exactes, mais certaines simplifications et le manque de sources formelles dans la vidéo limitent la note.

Chapitres

Sources citées

  • SIFT: Distinctive Image Features from Scale-Invariant Keypoints — Article original de Lowe (2004) présentant l'algorithme SIFT.
  • ImageNet Classification with Deep Convolutional Neural Networks — Article de Krizhevsky et al. (2012) introduisant AlexNet.
  • Very Deep Convolutional Networks for Large-Scale Image Recognition — Article de Simonyan et Zisserman (2014) présentant VGG.
  • Deep Residual Learning for Image Recognition — Article de He et al. (2015) introduisant ResNet.
  • Going Deeper with Convolutions — Article de Szegedy et al. (2014) présentant Inception.
  • Xception: Deep Learning with Depthwise Separable Convolutions — Article de Chollet (2016) présentant Xception.
  • MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications — Article de Howard et al. (2017) présentant MobileNet.
  • EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks — Article de Tan et Le (2019) présentant EfficientNet.
  • An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale — Article de Dosovitskiy et al. (2020) présentant le Vision Transformer.

Sources concordantes

  • ImageNet — Base de données d'images utilisée pour entraîner et évaluer les modèles de classification.

Apport & nouveautés

L’apport original de cette vidéo réside dans sa synthèse pédagogique des méthodes de classification d’images, allant des approches classiques (SIFT) aux architectures modernes (ViT), avec des explications intuitives et des schémas. Elle est utile pour les étudiants qui débutent en vision par ordinateur.

Pour aller plus loin :

  • Scale-invariant feature transform — Article Wikipédia détaillant l’algorithme SIFT.
  • Réseau neuronal convolutif — Article Wikipédia sur les CNN, base des architectures présentées.
  • Vision Transformer — Article Wikipédia sur le ViT, une architecture récente utilisant les transformers pour les images.

87 mots

Profil radar

Le profil radar montre des scores élevés en quantité d'information et en niveau technique, indiquant un contenu dense et spécialisé. La qualité de l'information et la fiabilité globale sont également bonnes, mais légèrement inférieures, ce qui suggère une présentation claire mais avec quelques simplifications.

Fiabilité 7/10