Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Xulin, Wang, Che, Lim, Wei Yang Bryan, Gao, Jianbo, Chen, Zhong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
par: Collu, Matteo Gioele, et autres
Publié: (2026)
par: Collu, Matteo Gioele, et autres
Publié: (2026)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
par: Linder, Noa, et autres
Publié: (2026)
par: Linder, Noa, et autres
Publié: (2026)
Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off
par: Chen, Yu, et autres
Publié: (2026)
par: Chen, Yu, et autres
Publié: (2026)
Furina: Fragmented Uncertainty-Driven Refusal Instability Attack
par: Wu, Tongxi, et autres
Publié: (2026)
par: Wu, Tongxi, et autres
Publié: (2026)
AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs
par: Wang, Che, et autres
Publié: (2026)
par: Wang, Che, et autres
Publié: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
par: Yin, Qingyu, et autres
Publié: (2025)
par: Yin, Qingyu, et autres
Publié: (2025)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
par: Campbell, David, et autres
Publié: (2026)
par: Campbell, David, et autres
Publié: (2026)
Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation
par: Zhang, Wentao, et autres
Publié: (2026)
par: Zhang, Wentao, et autres
Publié: (2026)
ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction
par: Wang, Che, et autres
Publié: (2026)
par: Wang, Che, et autres
Publié: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)
par: Chen, Guorui, et autres
Publié: (2025)
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
par: Xu, Zhenyu, et autres
Publié: (2026)
par: Xu, Zhenyu, et autres
Publié: (2026)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
par: Wu, Tianyi, et autres
Publié: (2025)
par: Wu, Tianyi, et autres
Publié: (2025)
SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters
par: Yang, Yan, et autres
Publié: (2024)
par: Yang, Yan, et autres
Publié: (2024)
Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry
par: Lan, Wenhao, et autres
Publié: (2026)
par: Lan, Wenhao, et autres
Publié: (2026)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
par: Li, Yanzeng, et autres
Publié: (2025)
par: Li, Yanzeng, et autres
Publié: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
par: Zhang, Tianyu, et autres
Publié: (2024)
par: Zhang, Tianyu, et autres
Publié: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
par: Ahmed, Mohamed, et autres
Publié: (2025)
par: Ahmed, Mohamed, et autres
Publié: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
par: Wang, Xunguang, et autres
Publié: (2025)
par: Wang, Xunguang, et autres
Publié: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
par: Long, Zhuohang, et autres
Publié: (2025)
par: Long, Zhuohang, et autres
Publié: (2025)
GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation
par: Ramesh, Govind, et autres
Publié: (2024)
par: Ramesh, Govind, et autres
Publié: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
par: Zou, Xiaotian, et autres
Publié: (2024)
par: Zou, Xiaotian, et autres
Publié: (2024)
Documents similaires
-
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
par: Collu, Matteo Gioele, et autres
Publié: (2026) -
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024) -
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
par: Chae, Kyubyung, et autres
Publié: (2025) -
A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models
par: Linder, Noa, et autres
Publié: (2026) -
Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off
par: Chen, Yu, et autres
Publié: (2026)