
Generative AI L26: LLM jail breaks, DAN jail breaks. Post training and fine-tuning LLMs
Mots-clés
Résumé
160 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur des informations est élevée : le cours fournit une explication claire des concepts de jailbreak, de prompt injection et d’alignement, avec des exemples concrets et des références à des travaux académiques. L’argumentation est solide, s’appuyant sur des cas réels (comme l’étude de 145 jailbreaks) et des démonstrations pratiques. L’instructeur adopte une approche pédagogique progressive, reliant les concepts à des situations pratiques. Cependant, certaines affirmations, comme l’absence de méthodes fiables de détection de l’IA, auraient pu être nuancées par des références plus récentes.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est bonne : l’instructeur cite des sources académiques (ACM CCS 2024) et des articles de presse (CNBC), et il recommande des ressources supplémentaires. La qualité des sources est correcte, mais certaines références ne sont pas détaillées dans la description. L’adéquation titre/contenu est bonne, le titre reflétant fidèlement les thèmes abordés. Les commentaires ne sont pas fournis, donc aucune analyse des tendances du public n’est possible.
167 mots
Adéquation titre / contenu
Le titre décrit bien le contenu : jailbreaks et post-entraînement/fine-tuning.
Qualité & fiabilité
8/10
Cours universitaire structuré, références académiques citées (ACM CCS 2024), exemples concrets, mais certaines affirmations non sourcées et ton parfois digressif.
Chapitres
- summary and conclusion of BERT,GPT,T5 comparison
- from capable to aligned
- LLM jailbreaks and DAN
- prompt injection attack & human caution
- jailbreak forbidden scenario example
- alignment usecases
- post training and fine tuning LLMs
- catastrophic forgetfullness
- good in one thing bad in all others
- single-task vs multi-task fine tuning
Sources citées
- Cours Generative AI (CSaLT) — Slides et évaluations du cours
- Playlist YouTube du cours — Accès à toutes les vidéos du cours
Sources concordantes
- Article CNBC sur les jailbreaks — Mentionné dans la vidéo comme exemple de manipulation
Apport & nouveautés
Le cours apporte une perspective pédagogique sur les jailbreaks et l’alignement des LLM, en reliant des concepts théoriques à des exemples pratiques. Il met en lumière l’importance de la sécurité et de l’éthique dans le déploiement des modèles de langage.
Pour aller plus loin :
- Article sur les jailbreaks de LLM — Contexte général sur l’ingénierie des prompts.
- Paper sur les attaques DAN — Analyse des jailbreaks DAN.
- Article sur le catastrophic forgetting — Explication du phénomène.
77 mots
Profil radar
Le profil radar montre un bon équilibre entre la quantité et la qualité des informations, avec une fiabilité globale élevée. Le niveau technique est soutenu, adapté à un public étudiant avancé.