CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Li, Xiaohu, Ning, Yunfeng, Bao, Zepeng, Xu, Mayi, Chen, Jianhao, Qian, Tieyun
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires