Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Cristofano, Tony |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
par: Cristofano, Tony
Publié: (2026)
par: Cristofano, Tony
Publié: (2026)
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation
par: Wang, Xinpeng, et autres
Publié: (2024)
par: Wang, Xinpeng, et autres
Publié: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
par: Yuan, Youliang, et autres
Publié: (2024)
par: Yuan, Youliang, et autres
Publié: (2024)
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
par: Lermen, Simon, et autres
Publié: (2024)
par: Lermen, Simon, et autres
Publié: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)
par: Si, Shengyun, et autres
Publié: (2025)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
par: Du, Yanrui, et autres
Publié: (2025)
par: Du, Yanrui, et autres
Publié: (2025)
Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
par: Ham, Seokil, et autres
Publié: (2025)
par: Ham, Seokil, et autres
Publié: (2025)
Refusal Direction is Universal Across Safety-Aligned Languages
par: Wang, Xinpeng, et autres
Publié: (2025)
par: Wang, Xinpeng, et autres
Publié: (2025)
Should LLM Safety Be More Than Refusing Harmful Instructions?
par: Maskey, Utsav, et autres
Publié: (2025)
par: Maskey, Utsav, et autres
Publié: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation
par: Jiang, Houcheng, et autres
Publié: (2025)
par: Jiang, Houcheng, et autres
Publié: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
par: Wollschläger, Tom, et autres
Publié: (2025)
par: Wollschläger, Tom, et autres
Publié: (2025)
From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training
par: Yuan, Yuan, et autres
Publié: (2025)
par: Yuan, Yuan, et autres
Publié: (2025)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
par: Han, Seungju, et autres
Publié: (2024)
par: Han, Seungju, et autres
Publié: (2024)
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
par: Zhang, Zhehao, et autres
Publié: (2025)
par: Zhang, Zhehao, et autres
Publié: (2025)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
par: Duan, Ranjie, et autres
Publié: (2025)
par: Duan, Ranjie, et autres
Publié: (2025)
Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries
par: Gondil, Tanay
Publié: (2026)
par: Gondil, Tanay
Publié: (2026)
Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs
par: Maskey, Utsav, et autres
Publié: (2026)
par: Maskey, Utsav, et autres
Publié: (2026)
Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs
par: Yuan, Shuzhou, et autres
Publié: (2025)
par: Yuan, Shuzhou, et autres
Publié: (2025)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
par: Hadeliya, Tsimur, et autres
Publié: (2025)
par: Hadeliya, Tsimur, et autres
Publié: (2025)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
par: Aswal, Darpan, et autres
Publié: (2025)
par: Aswal, Darpan, et autres
Publié: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
par: Jain, Neel, et autres
Publié: (2024)
par: Jain, Neel, et autres
Publié: (2024)
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
par: Zhang, Haonan, et autres
Publié: (2025)
par: Zhang, Haonan, et autres
Publié: (2025)
Cyclic Ablation: Testing Concept Localization against Functional Regeneration in AI
par: Kapelko, Eduard
Publié: (2025)
par: Kapelko, Eduard
Publié: (2025)
LLMs Encode Harmfulness and Refusal Separately
par: Zhao, Jiachen, et autres
Publié: (2025)
par: Zhao, Jiachen, et autres
Publié: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
par: García-Ferrero, Iker, et autres
Publié: (2025)
par: García-Ferrero, Iker, et autres
Publié: (2025)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
par: Casademunt, Helena, et autres
Publié: (2025)
par: Casademunt, Helena, et autres
Publié: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
Refusal in LLMs is an Affine Function
par: Marshall, Thomas, et autres
Publié: (2024)
par: Marshall, Thomas, et autres
Publié: (2024)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
par: Pan, Wenbo, et autres
Publié: (2025)
par: Pan, Wenbo, et autres
Publié: (2025)
Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement
par: Lu, Yuxiao, et autres
Publié: (2026)
par: Lu, Yuxiao, et autres
Publié: (2026)
Don't Say No: Jailbreaking LLM by Suppressing Refusal
par: Zhou, Yukai, et autres
Publié: (2024)
par: Zhou, Yukai, et autres
Publié: (2024)
Understanding Refusal in Language Models with Sparse Autoencoders
par: Yeo, Wei Jie, et autres
Publié: (2025)
par: Yeo, Wei Jie, et autres
Publié: (2025)
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
par: Chhabra, Vishnu Kabir, et autres
Publié: (2025)
Latent Concept Disentanglement in Transformer-based Language Models
par: Hong, Guan Zhe, et autres
Publié: (2025)
par: Hong, Guan Zhe, et autres
Publié: (2025)
Characterizing Selective Refusal Bias in Large Language Models
par: Khorramrouz, Adel, et autres
Publié: (2025)
par: Khorramrouz, Adel, et autres
Publié: (2025)
Documents similaires
-
Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
par: Cristofano, Tony
Publié: (2026) -
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation
par: Wang, Xinpeng, et autres
Publié: (2024) -
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
par: Yuan, Youliang, et autres
Publié: (2024) -
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
par: Lermen, Simon, et autres
Publié: (2024) -
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)