Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ouyang, Yang, Gu, Hengrui, Lin, Shuhang, Hua, Wenyue, Peng, Jie, Kailkhura, Bhavya, Gao, Meijun, Chen, Tianlong, Zhou, Kaixiong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
von: Xiong, Chen, et al.
Veröffentlicht: (2024)
von: Xiong, Chen, et al.
Veröffentlicht: (2024)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
von: Lu, Lin, et al.
Veröffentlicht: (2024)
von: Lu, Lin, et al.
Veröffentlicht: (2024)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
von: Xiang, Shiyu, et al.
Veröffentlicht: (2025)
von: Xiang, Shiyu, et al.
Veröffentlicht: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
von: Zhong, Xingwei, et al.
Veröffentlicht: (2025)
von: Zhong, Xingwei, et al.
Veröffentlicht: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
von: Derya, Kemal, et al.
Veröffentlicht: (2026)
von: Derya, Kemal, et al.
Veröffentlicht: (2026)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
von: Zhou, Yuqi, et al.
Veröffentlicht: (2024)
von: Zhou, Yuqi, et al.
Veröffentlicht: (2024)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2024)
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2024)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
von: Shang, Zhengchun, et al.
Veröffentlicht: (2025)
von: Shang, Zhengchun, et al.
Veröffentlicht: (2025)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
von: Kim, Heegyu, et al.
Veröffentlicht: (2024)
von: Kim, Heegyu, et al.
Veröffentlicht: (2024)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
von: Yang, Zhuoran, et al.
Veröffentlicht: (2025)
von: Yang, Zhuoran, et al.
Veröffentlicht: (2025)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
von: Chen, Beitao, et al.
Veröffentlicht: (2025)
von: Chen, Beitao, et al.
Veröffentlicht: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
von: Hao, Shuyang, et al.
Veröffentlicht: (2025)
von: Hao, Shuyang, et al.
Veröffentlicht: (2025)
When Mitigations Backfire: Timing Channel Attacks and Defense for PRAC-Based RowHammer Mitigations
von: Woo, Jeonghyun, et al.
Veröffentlicht: (2025)
von: Woo, Jeonghyun, et al.
Veröffentlicht: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
von: Guo, Yangyang, et al.
Veröffentlicht: (2025)
von: Guo, Yangyang, et al.
Veröffentlicht: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
von: Pan, Licheng, et al.
Veröffentlicht: (2026)
von: Pan, Licheng, et al.
Veröffentlicht: (2026)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
von: Mao, Yanxu, et al.
Veröffentlicht: (2025)
von: Mao, Yanxu, et al.
Veröffentlicht: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
von: Chen, Yulin, et al.
Veröffentlicht: (2024)
von: Chen, Yulin, et al.
Veröffentlicht: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
von: Gao, Sensen, et al.
Veröffentlicht: (2024)
von: Gao, Sensen, et al.
Veröffentlicht: (2024)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
von: Chen, Kejia, et al.
Veröffentlicht: (2026)
von: Chen, Kejia, et al.
Veröffentlicht: (2026)
Mitigating Jailbreaks with Intent-Aware LLMs
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2025)
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
von: Chen, Zejian, et al.
Veröffentlicht: (2026)
von: Chen, Zejian, et al.
Veröffentlicht: (2026)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
von: Li, Bangxin, et al.
Veröffentlicht: (2024)
von: Li, Bangxin, et al.
Veröffentlicht: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
von: Li, Xiaohu, et al.
Veröffentlicht: (2025)
von: Li, Xiaohu, et al.
Veröffentlicht: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
Quantum Attacks Targeting Nuclear Power Plants: Threat Analysis, Defense and Mitigation Strategies
von: Baseri, Yaser, et al.
Veröffentlicht: (2026)
von: Baseri, Yaser, et al.
Veröffentlicht: (2026)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
von: Piet, Julien, et al.
Veröffentlicht: (2025)
von: Piet, Julien, et al.
Veröffentlicht: (2025)
TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering
von: Thornton, Scott
Veröffentlicht: (2026)
von: Thornton, Scott
Veröffentlicht: (2026)
JNI Global References Are Still Vulnerable: Attacks and Defenses
von: He, Yi, et al.
Veröffentlicht: (2024)
von: He, Yi, et al.
Veröffentlicht: (2024)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
von: Du, Mengyao, et al.
Veröffentlicht: (2026)
von: Du, Mengyao, et al.
Veröffentlicht: (2026)
A Novel Classification of Attacks on Blockchain Layers: Vulnerabilities, Attacks, Mitigations, and Research Directions
von: Dwivedi, Kaustubh, et al.
Veröffentlicht: (2024)
von: Dwivedi, Kaustubh, et al.
Veröffentlicht: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
von: Wang, Xinkai, et al.
Veröffentlicht: (2025)
von: Wang, Xinkai, et al.
Veröffentlicht: (2025)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
von: Li, Yucheng, et al.
Veröffentlicht: (2025)
von: Li, Yucheng, et al.
Veröffentlicht: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2025)
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
von: Ni, Ziyi, et al.
Veröffentlicht: (2025)
von: Ni, Ziyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
von: Xiong, Chen, et al.
Veröffentlicht: (2024) -
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
von: Lu, Lin, et al.
Veröffentlicht: (2024) -
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
von: Xiang, Shiyu, et al.
Veröffentlicht: (2025) -
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
von: Zhong, Xingwei, et al.
Veröffentlicht: (2025) -
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)