Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Zhiyu, Qi, Zimo, Liu, Guangliang, Chen, Bocheng, Pedarsani, Ramtin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
par: Xue, Zhiyu, et autres
Publié: (2024)
par: Xue, Zhiyu, et autres
Publié: (2024)
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
par: Xue, Zhiyu, et autres
Publié: (2025)
par: Xue, Zhiyu, et autres
Publié: (2025)
Conflict-Aware Adversarial Training
par: Xue, Zhiyu, et autres
Publié: (2024)
par: Xue, Zhiyu, et autres
Publié: (2024)
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
par: Pan, Licheng, et autres
Publié: (2025)
par: Pan, Licheng, et autres
Publié: (2025)
Inverse Reinforcement Learning by Estimating Expertise of Demonstrators
par: Beliaev, Mark, et autres
Publié: (2024)
par: Beliaev, Mark, et autres
Publié: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)
par: Si, Shengyun, et autres
Publié: (2025)
LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
par: Zhang, Haonan, et autres
Publié: (2026)
par: Zhang, Haonan, et autres
Publié: (2026)
Altruistic Maneuver Planning for Cooperative Autonomous Vehicles Using Multi-agent Advantage Actor-Critic
par: Toghi, Behrad, et autres
Publié: (2021)
par: Toghi, Behrad, et autres
Publié: (2021)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
par: Campbell, David, et autres
Publié: (2026)
par: Campbell, David, et autres
Publié: (2026)
Learning to Refuse: Towards Mitigating Privacy Risks in LLMs
par: Liu, Zhenhua, et autres
Publié: (2024)
par: Liu, Zhenhua, et autres
Publié: (2024)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
par: Yin, Qingyu, et autres
Publié: (2025)
par: Yin, Qingyu, et autres
Publié: (2025)
Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off
par: Chen, Yu, et autres
Publié: (2026)
par: Chen, Yu, et autres
Publié: (2026)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
par: Xie, Tinghao, et autres
Publié: (2024)
par: Xie, Tinghao, et autres
Publié: (2024)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
par: Duan, Ranjie, et autres
Publié: (2025)
par: Duan, Ranjie, et autres
Publié: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
par: Yuan, Youliang, et autres
Publié: (2024)
par: Yuan, Youliang, et autres
Publié: (2024)
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
par: Zhang, Zhehao, et autres
Publié: (2025)
par: Zhang, Zhehao, et autres
Publié: (2025)
Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models
par: Parihar, Shweta, et autres
Publié: (2026)
par: Parihar, Shweta, et autres
Publié: (2026)
From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions
par: Alagharu, Rishab, et autres
Publié: (2026)
par: Alagharu, Rishab, et autres
Publié: (2026)
The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs
par: Deng, Yonghong, et autres
Publié: (2026)
par: Deng, Yonghong, et autres
Publié: (2026)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
par: Zhang, Haonan, et autres
Publié: (2025)
par: Zhang, Haonan, et autres
Publié: (2025)
LoRA is All You Need for Safety Alignment of Reasoning LLMs
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions
par: Wu, Xiaorui, et autres
Publié: (2025)
par: Wu, Xiaorui, et autres
Publié: (2025)
LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
par: Ren, Xuancheng, et autres
Publié: (2026)
par: Ren, Xuancheng, et autres
Publié: (2026)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
par: Chen, Jianhui, et autres
Publié: (2024)
par: Chen, Jianhui, et autres
Publié: (2024)
The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models
par: Hasan, Alif Al, et autres
Publié: (2026)
par: Hasan, Alif Al, et autres
Publié: (2026)
Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context
par: Zhang, Zhihao, et autres
Publié: (2026)
par: Zhang, Zhihao, et autres
Publié: (2026)
MedSentry: Understanding and Mitigating Safety Risks in Medical LLM Multi-Agent Systems
par: Chen, Kai, et autres
Publié: (2025)
par: Chen, Kai, et autres
Publié: (2025)
AlignKT: Explicitly Modeling Knowledge State for Knowledge Tracing with Ideal State Alignment
par: Xiao, Jing, et autres
Publié: (2025)
par: Xiao, Jing, et autres
Publié: (2025)
SPEX: Scaling Feature Interaction Explanations for LLMs
par: Kang, Justin Singh, et autres
Publié: (2025)
par: Kang, Justin Singh, et autres
Publié: (2025)
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)
par: Dabas, Mahavir, et autres
Publié: (2025)
The impact of multi-agent debate protocols on debate quality: a controlled case study
par: Marandi, Ramtin Zargari
Publié: (2026)
par: Marandi, Ramtin Zargari
Publié: (2026)
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
par: An, Zhiyu, et autres
Publié: (2025)
par: An, Zhiyu, et autres
Publié: (2025)
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
par: Yin, Bo, et autres
Publié: (2026)
par: Yin, Bo, et autres
Publié: (2026)
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
par: Pattison, Cameron, et autres
Publié: (2026)
par: Pattison, Cameron, et autres
Publié: (2026)
Mitigating Deceptive Alignment via Self-Monitoring
par: Ji, Jiaming, et autres
Publié: (2025)
par: Ji, Jiaming, et autres
Publié: (2025)
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
Documents similaires
-
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
par: Xue, Zhiyu, et autres
Publié: (2024) -
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
par: Xue, Zhiyu, et autres
Publié: (2025) -
Conflict-Aware Adversarial Training
par: Xue, Zhiyu, et autres
Publié: (2024) -
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
par: Pan, Licheng, et autres
Publié: (2025) -
Inverse Reinforcement Learning by Estimating Expertise of Demonstrators
par: Beliaev, Mark, et autres
Publié: (2024)