The munge function

The munge function

🎙 International Statistical Genetics Workshop 👥 3K 📅 18 mai 2026 ⏱ 16 min 👁 253 📄 tutoriel 🧭 2026-08-16
Disponible en : Français (actuel) English

Mots-clés

mungeGenomicSEMGWASLD score regressionprétraitement

Résumé

Cette vidéo, issue de l’atelier International Statistical Genetics Workshop, présente en détail la fonction munge du package GenomicSEM, qui prépare les données GWAS brutes pour l’analyse par LD score regression. L’orateur commence par rappeler les sources de données GWAS (biobanques, GWAS Catalog, consortiums) et les cinq informations essentielles requises : RSID, allèle effecteur (A1), allèle non-effecteur (A2), colonne d’effet signé (bêta, z ou odds ratio) et p-value. Il insiste sur l’importance de l’appariement de l’ascendance entre les études et avec les scores LD, et sur les critères de puissance (taille d’échantillon > 10 000, h2 SNP z > 4). Il détaille ensuite la gestion de la taille d’échantillon, notamment pour les traits binaires, avec la correction de l’échelle de liability et la prise en compte de l’ascertainment. Il explique comment calculer la somme des tailles d’échantillon effectives (NEFF) à partir des données, en présentant trois plans (A, B, C). Enfin, il décrit les arguments de la fonction munge (fichiers GWAS, fichier HapMap3, noms de traits, taille d’échantillon) et montre un exemple de code R, en soulignant l’importance de vérifier les fichiers de log. La vidéo se conclut sur la préparation des fichiers .sumstats.gz pour l’étape suivante de LDSC.

198 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur pédagogique certaine en expliquant pas à pas les étapes de prétraitement des données GWAS, un aspect souvent négligé mais crucial pour la fiabilité des analyses. L’argumentation est solide : l’orateur justifie chaque recommandation par des considérations statistiques (correction de l’échelle de liability, ascertainment) et s’appuie sur des références publiées (article de 2011 sur l’échelle de liability, publication dans Biological Psychiatry). Il anticipe également les erreurs courantes et propose des solutions pratiques, comme l’utilisation des fichiers .log pour vérifier le bon déroulement de munge. La démonstration par le code renforce la crédibilité de l’exposé.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est élevée : l’orateur cite des sources académiques (publication dans Biological Psychiatry, recommandations des développeurs de LDSC) et renvoie au GitHub du projet GenomicSEM pour plus de détails. Il précise les limites de la méthode (non multi-ancestralité) et les critères de puissance. L’adéquation entre le titre et le contenu est parfaite : la vidéo est entièrement consacrée à la fonction munge. Aucun commentaire n’étant fourni, il n’est pas possible d’analyser les tendances du public.

190 mots

Adéquation titre / contenu

Le titre est concis et correspond exactement au contenu : la vidéo est consacrée à la fonction munge du package GenomicSEM.

Qualité & fiabilité

8/10

Explication technique précise et détaillée, s'appuyant sur des références académiques (publication dans Biological Psychiatry, GitHub du projet) et des recommandations issues de la littérature (LDSC). La démarche est transparente et les pièges courants sont explicités.

Moments clés

Sources citées

  • GenomicSEM GitHub — Référentiel du package GenomicSEM, contenant la documentation et les fichiers de référence (HapMap3).
  • Publication dans Biological Psychiatry — Article détaillant l'équation pour calculer la somme des tailles d'échantillon effectives.
  • Article de 2011 sur l'échelle de liability — Discussion sur l'ascertainment dans les études cas-témoins et la correction de l'échelle de liability.

Sources concordantes

  • LDSC GitHub — Documentation et recommandations des développeurs de LDSC, notamment sur les critères de puissance et la gestion de la taille d'échantillon.

Apport & nouveautés

Cette vidéo apporte un éclairage pratique et détaillé sur une étape cruciale mais souvent négligée de l’analyse génomique : le prétraitement des données GWAS. Elle explicite les pièges liés à la taille d’échantillon, à l’ascertainment et à la correction de l’échelle de liability, et fournit des solutions concrètes (plans A, B, C pour obtenir NEFF). Elle met en avant l’importance de la vérification des logs et de la qualité des données en amont.

Pour aller plus loin :

  • LD Score Regression (LDSC) — Outil de référence pour l’estimation de l’héritabilité et de la corrélation génétique, utilisé en aval de munge.
  • GenomicSEM — Package R pour la modélisation d’équations structurelles appliquée aux données génomiques.
  • GWAS Catalog — Base de données des études d’association pangénomique, source de données GWAS.
  • Liability threshold model — Concept statistique sous-jacent à la correction de l’échelle de liability.

141 mots

Profil radar

Le profil radar montre une vidéo très équilibrée, avec des scores élevés en qualité et fiabilité de l'information, ainsi qu'un bon niveau technique. La quantité d'information est également importante, ce qui en fait une ressource précieuse pour les utilisateurs de GenomicSEM.

Fiabilité 8/10