CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiaohu, Ning, Yunfeng, Bao, Zepeng, Xu, Mayi, Chen, Jianhao, Qian, Tieyun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
par: Chen, Jianhao, et autres
Publié: (2025)
par: Chen, Jianhao, et autres
Publié: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
par: Shang, Zhengchun, et autres
Publié: (2025)
par: Shang, Zhengchun, et autres
Publié: (2025)
Toxicity Detection towards Adaptability to Changing Perturbations
par: Kang, Hankun, et autres
Publié: (2024)
par: Kang, Hankun, et autres
Publié: (2024)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
par: Ma, Jiachen, et autres
Publié: (2024)
par: Ma, Jiachen, et autres
Publié: (2024)
Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
par: Olatunji, Iyiola E., et autres
Publié: (2025)
par: Olatunji, Iyiola E., et autres
Publié: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
par: Jaiswal, Piyush, et autres
Publié: (2026)
par: Jaiswal, Piyush, et autres
Publié: (2026)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
par: Lin, Zheng, et autres
Publié: (2026)
par: Lin, Zheng, et autres
Publié: (2026)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
par: Jha, Pranav K
Publié: (2025)
par: Jha, Pranav K
Publié: (2025)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
par: Liu, Shuyuan, et autres
Publié: (2025)
par: Liu, Shuyuan, et autres
Publié: (2025)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
par: Hao, Shuyang, et autres
Publié: (2025)
par: Hao, Shuyang, et autres
Publié: (2025)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
par: Cui, Tiehan, et autres
Publié: (2025)
par: Cui, Tiehan, et autres
Publié: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
par: Mia, Md Jueal, et autres
Publié: (2026)
par: Mia, Md Jueal, et autres
Publié: (2026)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
par: Ning, Liangbo, et autres
Publié: (2025)
par: Ning, Liangbo, et autres
Publié: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
par: Xiang, Shiyu, et autres
Publié: (2025)
par: Xiang, Shiyu, et autres
Publié: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
par: Wang, Xi, et autres
Publié: (2026)
par: Wang, Xi, et autres
Publié: (2026)
Untargeted Jailbreak Attack
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
par: Fu, Haowei, et autres
Publié: (2025)
par: Fu, Haowei, et autres
Publié: (2025)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
par: Wu, Yuanwei, et autres
Publié: (2023)
par: Wu, Yuanwei, et autres
Publié: (2023)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
par: Li, Xurui, et autres
Publié: (2025)
par: Li, Xurui, et autres
Publié: (2025)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
par: Gong, Xueluan, et autres
Publié: (2024)
par: Gong, Xueluan, et autres
Publié: (2024)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
par: Yeo, Andrew, et autres
Publié: (2025)
par: Yeo, Andrew, et autres
Publié: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
par: Jiang, Weisen, et autres
Publié: (2025)
par: Jiang, Weisen, et autres
Publié: (2025)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
par: Xu, Yuming, et autres
Publié: (2026)
par: Xu, Yuming, et autres
Publié: (2026)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
par: Chen, Taiye, et autres
Publié: (2025)
par: Chen, Taiye, et autres
Publié: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
par: Zhong, Xingwei, et autres
Publié: (2025)
par: Zhong, Xingwei, et autres
Publié: (2025)
Documents similaires
-
RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
par: Chen, Jianhao, et autres
Publié: (2025) -
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
par: Shang, Zhengchun, et autres
Publié: (2025) -
Toxicity Detection towards Adaptability to Changing Perturbations
par: Kang, Hankun, et autres
Publié: (2024) -
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)