Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiong, Chen, Qi, Xiangyu, Chen, Pin-Yu, Ho, Tsung-Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
por: Lu, Lin, et al.
Publicado: (2024)
por: Lu, Lin, et al.
Publicado: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024)
por: Zeng, Yifan, et al.
Publicado: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
por: Chen, Zejian, et al.
Publicado: (2026)
por: Chen, Zejian, et al.
Publicado: (2026)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
por: Shang, Zhengchun, et al.
Publicado: (2025)
por: Shang, Zhengchun, et al.
Publicado: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
por: Xiang, Shiyu, et al.
Publicado: (2025)
por: Xiang, Shiyu, et al.
Publicado: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
por: Zhong, Xingwei, et al.
Publicado: (2025)
por: Zhong, Xingwei, et al.
Publicado: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
por: Xiong, Chen, et al.
Publicado: (2026)
por: Xiong, Chen, et al.
Publicado: (2026)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
por: Li, Xiaohu, et al.
Publicado: (2025)
por: Li, Xiaohu, et al.
Publicado: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)
por: Liu, Xiaoqun, et al.
Publicado: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
por: Ouyang, Yang, et al.
Publicado: (2025)
por: Ouyang, Yang, et al.
Publicado: (2025)
A Critical Evaluation of Defenses against Prompt Injection Attacks
por: Jia, Yuqi, et al.
Publicado: (2025)
por: Jia, Yuqi, et al.
Publicado: (2025)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
por: Liu, Shuyuan, et al.
Publicado: (2025)
por: Liu, Shuyuan, et al.
Publicado: (2025)
Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models
por: Liu, Deng, et al.
Publicado: (2026)
por: Liu, Deng, et al.
Publicado: (2026)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
por: Chen, Xuan, et al.
Publicado: (2024)
por: Chen, Xuan, et al.
Publicado: (2024)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
Query Provenance Analysis: Efficient and Robust Defense against Query-based Black-box Attacks
por: Li, Shaofei, et al.
Publicado: (2024)
por: Li, Shaofei, et al.
Publicado: (2024)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
por: Mao, Yanxu, et al.
Publicado: (2025)
por: Mao, Yanxu, et al.
Publicado: (2025)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024)
por: Chen, Bocheng, et al.
Publicado: (2024)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
por: Yeo, Andrew, et al.
Publicado: (2025)
por: Yeo, Andrew, et al.
Publicado: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
por: Yang, Zhuoran, et al.
Publicado: (2025)
por: Yang, Zhuoran, et al.
Publicado: (2025)
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
System-Level Defense against Indirect Prompt Injection Attacks: An Information Flow Control Perspective
por: Wu, Fangzhou, et al.
Publicado: (2024)
por: Wu, Fangzhou, et al.
Publicado: (2024)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
por: Li, Yucheng, et al.
Publicado: (2025)
por: Li, Yucheng, et al.
Publicado: (2025)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
por: Kang, Caixin, et al.
Publicado: (2023)
por: Kang, Caixin, et al.
Publicado: (2023)
Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
por: Cunningham, Hoagy, et al.
Publicado: (2026)
por: Cunningham, Hoagy, et al.
Publicado: (2026)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
por: Mai, Wuyuao, et al.
Publicado: (2025)
por: Mai, Wuyuao, et al.
Publicado: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
por: Nasr, Milad, et al.
Publicado: (2025)
por: Nasr, Milad, et al.
Publicado: (2025)
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
por: Chen, Luoyu, et al.
Publicado: (2026)
por: Chen, Luoyu, et al.
Publicado: (2026)
System Prompt Extraction Attacks and Defenses in Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2025)
por: Das, Badhan Chandra, et al.
Publicado: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Ejemplares similares
-
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025) -
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
por: Hu, Xiaomeng, et al.
Publicado: (2024) -
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
por: Lu, Lin, et al.
Publicado: (2024) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024) -
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
por: Chen, Zejian, et al.
Publicado: (2026)