Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Yu, Liu, Yuanhao, Cao, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
por: Yin, Qingyu, et al.
Publicado: (2025)
por: Yin, Qingyu, et al.
Publicado: (2025)
Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
por: Xie, Yuanbo, et al.
Publicado: (2025)
por: Xie, Yuanbo, et al.
Publicado: (2025)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
por: Ferrand, Jean-Charles Noirot, et al.
Publicado: (2025)
por: Ferrand, Jean-Charles Noirot, et al.
Publicado: (2025)
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
por: Li, Hongyi, et al.
Publicado: (2024)
por: Li, Hongyi, et al.
Publicado: (2024)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
por: Campbell, David, et al.
Publicado: (2026)
por: Campbell, David, et al.
Publicado: (2026)
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
por: Zhang, Jiawen, et al.
Publicado: (2025)
por: Zhang, Jiawen, et al.
Publicado: (2025)
The Privacy-Utility Trade-off in the Topics API
por: Alvim, Mário S., et al.
Publicado: (2024)
por: Alvim, Mário S., et al.
Publicado: (2024)
FlipAttack: Jailbreak LLMs via Flipping
por: Liu, Yue, et al.
Publicado: (2024)
por: Liu, Yue, et al.
Publicado: (2024)
Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
por: Wang, Ziwei, et al.
Publicado: (2026)
por: Wang, Ziwei, et al.
Publicado: (2026)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
por: Cui, Tiehan, et al.
Publicado: (2025)
por: Cui, Tiehan, et al.
Publicado: (2025)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
por: Gong, Xueluan, et al.
Publicado: (2024)
por: Gong, Xueluan, et al.
Publicado: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
A Unified Learn-to-Distort-Data Framework for Privacy-Utility Trade-off in Trustworthy Federated Learning
por: Zhang, Xiaojin, et al.
Publicado: (2024)
por: Zhang, Xiaojin, et al.
Publicado: (2024)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
Clients Collaborate: Flexible Differentially Private Federated Learning with Guaranteed Improvement of Utility-Privacy Trade-off
por: Li, Yuecheng, et al.
Publicado: (2024)
por: Li, Yuecheng, et al.
Publicado: (2024)
Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards
por: Hammadia, Taha, et al.
Publicado: (2026)
por: Hammadia, Taha, et al.
Publicado: (2026)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
por: Rando, Javier, et al.
Publicado: (2024)
por: Rando, Javier, et al.
Publicado: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
por: Cheng, Siyang, et al.
Publicado: (2025)
por: Cheng, Siyang, et al.
Publicado: (2025)
Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data
por: Inane, Ahmed Mehdi, et al.
Publicado: (2026)
por: Inane, Ahmed Mehdi, et al.
Publicado: (2026)
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
por: Collu, Matteo Gioele, et al.
Publicado: (2026)
por: Collu, Matteo Gioele, et al.
Publicado: (2026)
Confusion is the Final Barrier: Rethinking Jailbreak Evaluation and Investigating the Real Misuse Threat of LLMs
por: Yan, Yu, et al.
Publicado: (2025)
por: Yan, Yu, et al.
Publicado: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025)
por: Yang, Xianglin, et al.
Publicado: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)
por: Liu, Xiaoqun, et al.
Publicado: (2024)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
por: Wu, Jinman, et al.
Publicado: (2026)
por: Wu, Jinman, et al.
Publicado: (2026)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
por: Xiang, Shiyu, et al.
Publicado: (2025)
por: Xiang, Shiyu, et al.
Publicado: (2025)
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
por: Fu, Yu, et al.
Publicado: (2026)
por: Fu, Yu, et al.
Publicado: (2026)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
por: Jaiswal, Piyush, et al.
Publicado: (2026)
por: Jaiswal, Piyush, et al.
Publicado: (2026)
Re-Triggering Safeguards within LLMs for Jailbreak Detection
por: Lin, Zheng, et al.
Publicado: (2026)
por: Lin, Zheng, et al.
Publicado: (2026)
PUZZLED: Jailbreaking LLMs through Word-Based Puzzles
por: Ahn, Yelim, et al.
Publicado: (2025)
por: Ahn, Yelim, et al.
Publicado: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
por: Xu, Zhao, et al.
Publicado: (2024)
por: Xu, Zhao, et al.
Publicado: (2024)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
por: Li, Qinfeng, et al.
Publicado: (2025)
por: Li, Qinfeng, et al.
Publicado: (2025)
Revisiting Privacy-Utility Trade-off for DP Training with Pre-existing Knowledge
por: Zheng, Yu, et al.
Publicado: (2024)
por: Zheng, Yu, et al.
Publicado: (2024)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
por: Sun, Zhen, et al.
Publicado: (2025)
por: Sun, Zhen, et al.
Publicado: (2025)
One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs
por: Tan, Yixin, et al.
Publicado: (2025)
por: Tan, Yixin, et al.
Publicado: (2025)
SafeDream: Safety World Model for Proactive Early Jailbreak Detection
por: Yan, Bo, et al.
Publicado: (2026)
por: Yan, Bo, et al.
Publicado: (2026)
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
por: Wu, Daoyuan, et al.
Publicado: (2024)
por: Wu, Daoyuan, et al.
Publicado: (2024)
Ejemplares similares
-
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
por: Andriushchenko, Maksym, et al.
Publicado: (2024) -
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
por: Yin, Qingyu, et al.
Publicado: (2025) -
Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
por: Xie, Yuanbo, et al.
Publicado: (2025) -
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026) -
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
por: Ferrand, Jean-Charles Noirot, et al.
Publicado: (2025)