Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zejian, Li, Chaozhuo, Li, Chao, Zhang, Xi, Zhang, Litian, He, Yiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
por: Liu, Songyang, et al.
Publicado: (2026)
por: Liu, Songyang, et al.
Publicado: (2026)
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
por: Pu, Rui, et al.
Publicado: (2025)
por: Pu, Rui, et al.
Publicado: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
por: Pu, Rui, et al.
Publicado: (2024)
por: Pu, Rui, et al.
Publicado: (2024)
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
por: Liu, Songyang, et al.
Publicado: (2025)
por: Liu, Songyang, et al.
Publicado: (2025)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
por: Liu, Songyang, et al.
Publicado: (2026)
por: Liu, Songyang, et al.
Publicado: (2026)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
por: Li, Xiaohu, et al.
Publicado: (2025)
por: Li, Xiaohu, et al.
Publicado: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
por: Xiong, Chen, et al.
Publicado: (2024)
por: Xiong, Chen, et al.
Publicado: (2024)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
por: Sun, Bowen, et al.
Publicado: (2026)
por: Sun, Bowen, et al.
Publicado: (2026)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
por: Xiang, Shiyu, et al.
Publicado: (2025)
por: Xiang, Shiyu, et al.
Publicado: (2025)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
por: Mai, Wuyuao, et al.
Publicado: (2025)
por: Mai, Wuyuao, et al.
Publicado: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)
por: Liu, Xiaoqun, et al.
Publicado: (2024)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
por: Jia, Xiaojun, et al.
Publicado: (2025)
por: Jia, Xiaojun, et al.
Publicado: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
por: He, Zeqing, et al.
Publicado: (2024)
por: He, Zeqing, et al.
Publicado: (2024)
PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation
por: Yan, Bingyu, et al.
Publicado: (2026)
por: Yan, Bingyu, et al.
Publicado: (2026)
Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
por: Zhou, Yuxuan, et al.
Publicado: (2025)
por: Zhou, Yuxuan, et al.
Publicado: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
por: Wang, Xi, et al.
Publicado: (2026)
por: Wang, Xi, et al.
Publicado: (2026)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
por: Lu, Lin, et al.
Publicado: (2024)
por: Lu, Lin, et al.
Publicado: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
por: Zhang, Xiaozhe, et al.
Publicado: (2026)
por: Zhang, Xiaozhe, et al.
Publicado: (2026)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
por: Shang, Zhengchun, et al.
Publicado: (2025)
por: Shang, Zhengchun, et al.
Publicado: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
por: Wang, Yiming, et al.
Publicado: (2024)
por: Wang, Yiming, et al.
Publicado: (2024)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
por: Chen, Beitao, et al.
Publicado: (2025)
por: Chen, Beitao, et al.
Publicado: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
por: Wang, Xinkai, et al.
Publicado: (2025)
por: Wang, Xinkai, et al.
Publicado: (2025)
Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS
por: Yan, Bingyu, et al.
Publicado: (2025)
por: Yan, Bingyu, et al.
Publicado: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
por: Zhong, Xingwei, et al.
Publicado: (2025)
por: Zhong, Xingwei, et al.
Publicado: (2025)
From static to adaptive: immune memory-based jailbreak detection for large language models
por: Leng, Jun, et al.
Publicado: (2025)
por: Leng, Jun, et al.
Publicado: (2025)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
por: Mao, Yanxu, et al.
Publicado: (2025)
por: Mao, Yanxu, et al.
Publicado: (2025)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
por: Yang, Zhuoran, et al.
Publicado: (2025)
por: Yang, Zhuoran, et al.
Publicado: (2025)
System Password Security: Attack and Defense Mechanisms
por: Shi, Chaofang, et al.
Publicado: (2025)
por: Shi, Chaofang, et al.
Publicado: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
por: Derya, Kemal, et al.
Publicado: (2026)
por: Derya, Kemal, et al.
Publicado: (2026)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
por: Du, Mengyao, et al.
Publicado: (2026)
por: Du, Mengyao, et al.
Publicado: (2026)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
por: Gong, Xueluan, et al.
Publicado: (2024)
por: Gong, Xueluan, et al.
Publicado: (2024)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025)
por: Yang, Xianglin, et al.
Publicado: (2025)
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
por: Chen, Luoyu, et al.
Publicado: (2026)
por: Chen, Luoyu, et al.
Publicado: (2026)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
por: Li, Linbao, et al.
Publicado: (2025)
por: Li, Linbao, et al.
Publicado: (2025)
BadActs: A Universal Backdoor Defense in the Activation Space
por: Yi, Biao, et al.
Publicado: (2024)
por: Yi, Biao, et al.
Publicado: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024)
por: Chen, Bocheng, et al.
Publicado: (2024)
Jailbreaking Generative AI: Multivector Phishing Threats and Transformer based Defenses
por: Mishra, Rina, et al.
Publicado: (2025)
por: Mishra, Rina, et al.
Publicado: (2025)
Ejemplares similares
-
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
por: Liu, Songyang, et al.
Publicado: (2026) -
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
por: Pu, Rui, et al.
Publicado: (2025) -
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
por: Pu, Rui, et al.
Publicado: (2024) -
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
por: Liu, Songyang, et al.
Publicado: (2025) -
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
por: Liu, Songyang, et al.
Publicado: (2026)