SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Zouying, Yang, Yifei, Zhao, Hai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LaCo: Large Language Model Pruning via Layer Collapse
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
The Rogue Scalpel: Activation Steering Compromises LLM Safety
par: Korznikov, Anton, et autres
Publié: (2025)
par: Korznikov, Anton, et autres
Publié: (2025)
Activation Steering for Bias Mitigation: An Interpretable Approach to Safer LLMs
par: Dubey, Shivam
Publié: (2025)
par: Dubey, Shivam
Publié: (2025)
Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering
par: Li, Xiaomin, et autres
Publié: (2026)
par: Li, Xiaomin, et autres
Publié: (2026)
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
par: Röttger, Paul, et autres
Publié: (2023)
par: Röttger, Paul, et autres
Publié: (2023)
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
par: Zhang, Shiqi, et autres
Publié: (2025)
par: Zhang, Shiqi, et autres
Publié: (2025)
Conditioned Activation Transport for T2I Safety Steering
par: Chrabąszcz, Maciej, et autres
Publié: (2026)
par: Chrabąszcz, Maciej, et autres
Publié: (2026)
LESA: Learnable LLM Layer Scaling-Up
par: Yang, Yifei, et autres
Publié: (2025)
par: Yang, Yifei, et autres
Publié: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
par: Tran, Thanh Q., et autres
Publié: (2026)
par: Tran, Thanh Q., et autres
Publié: (2026)
Trust & Safety of LLMs and LLMs in Trust & Safety
par: You, Doohee, et autres
Publié: (2024)
par: You, Doohee, et autres
Publié: (2024)
TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering
par: Sui, Yuan, et autres
Publié: (2026)
par: Sui, Yuan, et autres
Publié: (2026)
Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models
par: Xie, Yingsha, et autres
Publié: (2026)
par: Xie, Yingsha, et autres
Publié: (2026)
Relationship-Aware Safety Unlearning for Multimodal LLMs
par: Anilkumar, Vishnu Narayanan, et autres
Publié: (2026)
par: Anilkumar, Vishnu Narayanan, et autres
Publié: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
par: Dunefsky, Jacob, et autres
Publié: (2025)
par: Dunefsky, Jacob, et autres
Publié: (2025)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
par: Torres-Fonseca, Josue, et autres
Publié: (2026)
par: Torres-Fonseca, Josue, et autres
Publié: (2026)
Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers
par: Xue, Zihao, et autres
Publié: (2026)
par: Xue, Zihao, et autres
Publié: (2026)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
Head-wise Shareable Attention for Large Language Models
par: Cao, Zouying, et autres
Publié: (2024)
par: Cao, Zouying, et autres
Publié: (2024)
Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection
par: Kang, Minjae, et autres
Publié: (2026)
par: Kang, Minjae, et autres
Publié: (2026)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
par: Yeon, Jehyeok, et autres
Publié: (2025)
par: Yeon, Jehyeok, et autres
Publié: (2025)
Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
Mitigating Exaggerated Safety in Large Language Models
par: Ray, Ruchira, et autres
Publié: (2024)
par: Ray, Ruchira, et autres
Publié: (2024)
Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary
par: Pan, Licheng, et autres
Publié: (2025)
par: Pan, Licheng, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Steering Towards Fairness: Mitigating Political Bias in LLMs
par: Nadeem, Afrozah, et autres
Publié: (2025)
par: Nadeem, Afrozah, et autres
Publié: (2025)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
par: Valentino, Marco, et autres
Publié: (2025)
par: Valentino, Marco, et autres
Publié: (2025)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
par: Jan, Essa, et autres
Publié: (2024)
par: Jan, Essa, et autres
Publié: (2024)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
LongSafety: Enhance Safety for Long-Context LLMs
par: Huang, Mianqiu, et autres
Publié: (2024)
par: Huang, Mianqiu, et autres
Publié: (2024)
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
par: Zhang, Jiawen, et autres
Publié: (2025)
par: Zhang, Jiawen, et autres
Publié: (2025)
Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers
par: Ravindran, Santhosh Kumar
Publié: (2025)
par: Ravindran, Santhosh Kumar
Publié: (2025)
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
par: Zhang, Zhehao, et autres
Publié: (2025)
par: Zhang, Zhehao, et autres
Publié: (2025)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
par: Jiang, Yukun, et autres
Publié: (2026)
par: Jiang, Yukun, et autres
Publié: (2026)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)
par: Si, Shengyun, et autres
Publié: (2025)
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
par: Shen, Guobin, et autres
Publié: (2025)
par: Shen, Guobin, et autres
Publié: (2025)
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
par: Banerjee, Somnath, et autres
Publié: (2025)
par: Banerjee, Somnath, et autres
Publié: (2025)
Documents similaires
-
LaCo: Large Language Model Pruning via Layer Collapse
par: Yang, Yifei, et autres
Publié: (2024) -
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025) -
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
par: Cao, Zouying, et autres
Publié: (2025) -
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024) -
The Rogue Scalpel: Activation Steering Compromises LLM Safety
par: Korznikov, Anton, et autres
Publié: (2025)