
Lets Run GLM-4.7-REAP - ALL the Intelligence at HALF the RAM? Local AI REVIEW
Testons GLM-4.7-REAP : toute l’intelligence avec la moitié de la RAM ? Avis de Local AI
Mots-clés
Résumé
214 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur principale réside dans le test concret et comparatif de deux variantes REAP sur une même configuration matérielle. L’argumentation s’appuie sur des mesures de perplexité, de vitesse d’inférence, d’utilisation mémoire et sur des évaluations qualitatives de rendus 3D ou d’applications bureautiques générées. Toutefois, les tests sont limités en nombre d’échantillons et non standardisés ; la perplexité n’est testée que sur un type de tâche (codage). Le présentateur reconnaît une part de hasard dans les graines de génération. Sa conclusion remet en cause l’affirmation de Cerebras de manière cohérente, mais sans protocole rigoureux. L’usage d’une comparaison avec une version à experts réduits est intéressante mais peu approfondie.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est moyenne : les résultats sont présentés sous forme de captures et de mesures locales, mais aucune réplication indépendante. Les sources citées se limitent aux liens Hugging Face des modèles testés et à l’application Inferencer, sans référence aux publications officielles de Cerebras. L’adéquation titre/contenu est partielle : le titre suggère une performance conservée à moitié RAM, or les tests montrent une dégradation visible, surtout pour le code. Les commentaires ne sont pas analysés (aucun fourni), donc aucune tendance publique n’est évaluée.
206 mots
Adéquation titre / contenu
Le titre est accrocheur mais partiellement trompeur : la performance n'est pas 'identique' selon les tests, et la RAM réduite est confirmée mais au détriment de la qualité.
Qualité & fiabilité
6/10
Test empirique sur un modèle spécifique, mais méthodologie peu détaillée (perplexité mesurée sur un seul échantillon, tests subjectifs). Sources limitées aux liens Hugging Face et au site de l'app. Les performances mesurées sont reproductibles dans le contexte donné.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et présentation des versions REAP (218B et 268B)
- Comparaison d'images 3D générées (base vs REAP)
- Tableau de perplexité : REAP moins bon que base Q6
- Test de raisonnement avec batch (chirurgien, trolley)
- Test de génération de code : solution RAG avec regex
- Mesure de mémoire : 207 GiB pour REAP 268B
- Comparaison avec base GLM 4.7 en mode experts réduits
- Résultats finaux : REAP moins performant que prévu
- Conclusion et espoir d'améliorations futures
Sources citées
- GLM-4.7-MLX-6.5bit (modèle de base) — Modèle de référence utilisé pour comparer avec les versions REAP
- GLM-4.7-REAP-218B-A32B-MLX-6.5bit — Version REAP de 218 milliards de paramètres testée
- GLM-4.7-REAP-268B-A32B-MLX-6.5bit — Version REAP de 268 milliards de paramètres testée
- Inferencer App — Application utilisée pour exécuter les modèles localement
- Vidéo sur GLM 4.7 (de base) — Vidéo complémentaire sur GLM 4.7
Sources concordantes
- GLM-4.7-REAP-268B-A32B-MLX-6.5bit — Les résultats de perplexité obtenus sont cohérents avec l'hypothèse d'une moindre qualité due à l'élagage.
Sources discordantes
- GLM-4.7-MLX-6.5bit — La version de base montre une perplexité inférieure, indiquant que les affirmations de Cerebras sur une performance identique sont exagérées.
Références externes
Apport & nouveautés
Cette vidéo apporte un retour concret sur l’utilisation des variantes REAP de GLM-4.7, un modèle open-weight récent. Elle documente des mesures pratiques (perplexité, vitesse, mémoire) sur matériel haut de gamme, montrant que la compression par élagage d’experts entraîne une dégradation notable, surtout en génération de code. Elle propose une alternative (quantification de la version complète) qui peut être plus efficace.
Pour aller plus loin :
- Réduction d’experts dans les MoE — Concepts liés aux modèles à mélange d’experts et élagage.
- Perplexité (traitement du langage) — Mesure utilisée pour évaluer la qualité de prédiction.
- Quantification en apprentissage automatique — L’alternative proposée pour réduire la mémoire.
- Cerebras Systems — Fabricant du matériel, partenaire d’OpenAI (accord de 10 milliards mentionné).
117 mots
Profil radar
Le profil radar montre une note moyenne en quantité d'information et en niveau technique (6/10), mais plus faible en qualité d'information et en fiabilité (5/10), reflétant un contenu basé sur des essais empiriques sans protocole strict.