Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning
Fuente:
arXiv
Salvato in:
| Autore principale: | Cristofano, Tony |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
di: Cristofano, Tony
Pubblicazione: (2026)
di: Cristofano, Tony
Pubblicazione: (2026)
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
di: Lermen, Simon, et al.
Pubblicazione: (2024)
di: Lermen, Simon, et al.
Pubblicazione: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
di: Si, Shengyun, et al.
Pubblicazione: (2025)
di: Si, Shengyun, et al.
Pubblicazione: (2025)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
di: Du, Yanrui, et al.
Pubblicazione: (2025)
di: Du, Yanrui, et al.
Pubblicazione: (2025)
Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
di: Ham, Seokil, et al.
Pubblicazione: (2025)
di: Ham, Seokil, et al.
Pubblicazione: (2025)
Refusal Direction is Universal Across Safety-Aligned Languages
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
Should LLM Safety Be More Than Refusing Harmful Instructions?
di: Maskey, Utsav, et al.
Pubblicazione: (2025)
di: Maskey, Utsav, et al.
Pubblicazione: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation
di: Jiang, Houcheng, et al.
Pubblicazione: (2025)
di: Jiang, Houcheng, et al.
Pubblicazione: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
di: Anonto, Riad Ahmed, et al.
Pubblicazione: (2025)
di: Anonto, Riad Ahmed, et al.
Pubblicazione: (2025)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training
di: Yuan, Yuan, et al.
Pubblicazione: (2025)
di: Yuan, Yuan, et al.
Pubblicazione: (2025)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
di: Han, Seungju, et al.
Pubblicazione: (2024)
di: Han, Seungju, et al.
Pubblicazione: (2024)
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
di: Asif, Sadia, et al.
Pubblicazione: (2026)
di: Asif, Sadia, et al.
Pubblicazione: (2026)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
di: Duan, Ranjie, et al.
Pubblicazione: (2025)
di: Duan, Ranjie, et al.
Pubblicazione: (2025)
Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries
di: Gondil, Tanay
Pubblicazione: (2026)
di: Gondil, Tanay
Pubblicazione: (2026)
Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs
di: Maskey, Utsav, et al.
Pubblicazione: (2026)
di: Maskey, Utsav, et al.
Pubblicazione: (2026)
Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
di: Chae, Kyubyung, et al.
Pubblicazione: (2025)
di: Chae, Kyubyung, et al.
Pubblicazione: (2025)
ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
di: Aswal, Darpan, et al.
Pubblicazione: (2025)
di: Aswal, Darpan, et al.
Pubblicazione: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
di: Jain, Neel, et al.
Pubblicazione: (2024)
di: Jain, Neel, et al.
Pubblicazione: (2024)
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
di: Zhang, Haonan, et al.
Pubblicazione: (2025)
di: Zhang, Haonan, et al.
Pubblicazione: (2025)
Cyclic Ablation: Testing Concept Localization against Functional Regeneration in AI
di: Kapelko, Eduard
Pubblicazione: (2025)
di: Kapelko, Eduard
Pubblicazione: (2025)
LLMs Encode Harmfulness and Refusal Separately
di: Zhao, Jiachen, et al.
Pubblicazione: (2025)
di: Zhao, Jiachen, et al.
Pubblicazione: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Refusal in LLMs is an Affine Function
di: Marshall, Thomas, et al.
Pubblicazione: (2024)
di: Marshall, Thomas, et al.
Pubblicazione: (2024)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement
di: Lu, Yuxiao, et al.
Pubblicazione: (2026)
di: Lu, Yuxiao, et al.
Pubblicazione: (2026)
Don't Say No: Jailbreaking LLM by Suppressing Refusal
di: Zhou, Yukai, et al.
Pubblicazione: (2024)
di: Zhou, Yukai, et al.
Pubblicazione: (2024)
Understanding Refusal in Language Models with Sparse Autoencoders
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
Latent Concept Disentanglement in Transformer-based Language Models
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
Characterizing Selective Refusal Bias in Large Language Models
di: Khorramrouz, Adel, et al.
Pubblicazione: (2025)
di: Khorramrouz, Adel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
di: Cristofano, Tony
Pubblicazione: (2026) -
Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation
di: Wang, Xinpeng, et al.
Pubblicazione: (2024) -
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024) -
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
di: Lermen, Simon, et al.
Pubblicazione: (2024) -
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
di: Si, Shengyun, et al.
Pubblicazione: (2025)