Insights and Epic Fails from 5 Years of Building ML Platforms

Insights and Epic Fails from 5 Years of Building ML Platforms

🎙 Eric Riddoch 👥 5K 📅 24 octobre 2025 ⏱ 43 min 👁 87 📄 retour d'expérience 🧭 2026-08-15
Disponible en : Français (actuel) English

Mots-clés

MLOpsplateforme MLdata qualitydata lineageéchecs

Résumé

Eric Riddoch, directeur de la plateforme ML chez Pattern AI, partage son expérience de cinq ans dans la construction de plateformes ML. Il commence par son parcours, de data engineer à MLOps, puis aborde les problèmes classiques de collaboration entre data scientists et ingénieurs. Il souligne l’importance de permettre aux data scientists de déployer et maintenir leurs propres modèles pour itérer rapidement. Il présente une taxonomie des outils MLOps en ‘jobs to be done’ et un schéma d’architecture générique. Il relate plusieurs échecs majeurs : un premier projet qui a pris 18 mois pour échouer, un incident de data quality ayant coûté 250 000 dollars en un week-end, et un problème de prolifération de pipelines et de tables devenus ingérables. Il insiste sur le fait que la plupart des pannes ML sont dues à des problèmes de qualité des données, pas à des pannes système. Il recommande l’utilisation d’outils de data lineage comme OpenLineage pour comprendre les dépendances entre les données. Il conclut en soulignant l’importance de la gouvernance des données et de la simplicité des outils.

177 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La valeur des informations est élevée pour les praticiens du MLOps : l’orateur partage des leçons concrètes et des exemples chiffrés (coût de 250 000 $, 18 mois de développement). L’argumentation est solide, basée sur des expériences réelles et des observations. Il démontre de manière convaincante que les problèmes de qualité des données sont plus fréquents que les pannes d’infrastructure. Il propose des solutions pratiques comme l’auto-service pour les data scientists et l’utilisation de data lineage. Son discours est structuré et illustré par des anecdotes pertinentes.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : il s’agit d’un retour d’expérience, pas d’une étude scientifique. Les sources citées sont principalement des outils et des conférences (MLOps World, ZenML, etc.), mais aucune référence académique n’est fournie. Le titre est en adéquation avec le contenu. La description de la vidéo fournit des informations supplémentaires sur le contexte et les points clés, ce qui renforce la crédibilité. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.

180 mots

Adéquation titre / contenu

Le titre correspond parfaitement au contenu : l'orateur partage des leçons apprises et des échecs concrets sur la construction de plateformes ML.

Qualité & fiabilité

7/10

Retour d'expérience concret et honnête, basé sur plusieurs années de pratique en entreprise. Les exemples sont précis et crédibles, mais il s'agit d'un témoignage personnel sans validation externe. Les références à des outils et concepts sont correctes, mais aucune source académique n'est citée.

Moments clés

Sources citées

  • MLOps World — Conférence où la présentation a été enregistrée

Sources concordantes

  • MLOps World — Conférence où la présentation a été enregistrée

Apport & nouveautés

L’apport original de cette vidéo est de fournir un retour d’expérience honnête et détaillé sur les échecs et les réussites dans la construction de plateformes ML, avec des exemples concrets et des chiffres. L’orateur remet en question certaines idées reçues, comme l’importance du monitoring de dérive, et propose des alternatives pratiques. Il met en lumière l’importance de la qualité des données et du data lineage, souvent négligés.

Pour aller plus loin :

  • OpenLineage — Standard ouvert pour le data lineage, directement lié à la recommandation de l’orateur.
  • Great Expectations — Outil de validation des données, mentionné comme solution pour détecter les problèmes de qualité.
  • ZenML — Framework MLOps qui a inspiré la taxonomie des jobs to be done.

118 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et une fiabilité globale correcte, mais un niveau technique modéré et une qualité d'information moyenne. Cela reflète un retour d'expérience pratique plutôt qu'un contenu académique.

Fiabilité 7/10