Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
Fuente:
arXiv
Salvato in:
| Autori principali: | Shang, Zhengchun, Wei, Wenlan, Bai, Weiheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
FedSecurity: Benchmarking Attacks and Defenses in Federated Learning and Federated LLMs
di: Han, Shanshan, et al.
Pubblicazione: (2023)
di: Han, Shanshan, et al.
Pubblicazione: (2023)
FlipAttack: Jailbreak LLMs via Flipping
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
di: Liu, Shuyuan, et al.
Pubblicazione: (2025)
di: Liu, Shuyuan, et al.
Pubblicazione: (2025)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
di: Xu, Yuming, et al.
Pubblicazione: (2026)
di: Xu, Yuming, et al.
Pubblicazione: (2026)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
di: Yeo, Andrew, et al.
Pubblicazione: (2025)
di: Yeo, Andrew, et al.
Pubblicazione: (2025)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities
di: Yang, Nanzi, et al.
Pubblicazione: (2026)
di: Yang, Nanzi, et al.
Pubblicazione: (2026)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
di: Lin, Zheng, et al.
Pubblicazione: (2026)
di: Lin, Zheng, et al.
Pubblicazione: (2026)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent
di: Shang, Shang, et al.
Pubblicazione: (2024)
di: Shang, Shang, et al.
Pubblicazione: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
di: Cunningham, Hoagy, et al.
Pubblicazione: (2026)
di: Cunningham, Hoagy, et al.
Pubblicazione: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
di: Fu, Haowei, et al.
Pubblicazione: (2025)
di: Fu, Haowei, et al.
Pubblicazione: (2025)
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
Pathway to Secure and Trustworthy ZSM for LLMs: Attacks, Defense, and Opportunities
di: Khowaja, Sunder Ali, et al.
Pubblicazione: (2024)
di: Khowaja, Sunder Ali, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
di: Wang, Xi, et al.
Pubblicazione: (2026)
di: Wang, Xi, et al.
Pubblicazione: (2026)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
di: Long, Zhuohang, et al.
Pubblicazione: (2025)
di: Long, Zhuohang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024) -
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025) -
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)