AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sheng, Leheng, Shen, Changshuo, Zhao, Weixiang, Fang, Junfeng, Liu, Xiaohao, Liang, Zhenkai, Wang, Xiang, Zhang, An, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
par: Yin, Rui, et autres
Publié: (2026)
par: Yin, Rui, et autres
Publié: (2026)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
par: Lin, Weilin, et autres
Publié: (2025)
par: Lin, Weilin, et autres
Publié: (2025)
MASKDROID: Robust Android Malware Detection with Masked Graph Representations
par: Zheng, Jingnan, et autres
Publié: (2024)
par: Zheng, Jingnan, et autres
Publié: (2024)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
par: Zeng, Xiyu, et autres
Publié: (2025)
par: Zeng, Xiyu, et autres
Publié: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
par: Fang, Junfeng, et autres
Publié: (2025)
par: Fang, Junfeng, et autres
Publié: (2025)
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
par: Xu, Zhiyuan, et autres
Publié: (2025)
par: Xu, Zhiyuan, et autres
Publié: (2025)
FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems
par: Li, Fanxiao, et autres
Publié: (2026)
par: Li, Fanxiao, et autres
Publié: (2026)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
par: Xiong, Chen, et autres
Publié: (2026)
par: Xiong, Chen, et autres
Publié: (2026)
Analysing the Safety Pitfalls of Steering Vectors
par: Li, Yuxiao, et autres
Publié: (2026)
par: Li, Yuxiao, et autres
Publié: (2026)
From Storage to Steering: Memory Control Flow Attacks on LLM Agents
par: Xu, Zhenlin, et autres
Publié: (2026)
par: Xu, Zhenlin, et autres
Publié: (2026)
MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
par: Lintelo, Jona te, et autres
Publié: (2026)
par: Lintelo, Jona te, et autres
Publié: (2026)
Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
par: Liu, Yiyong, et autres
Publié: (2026)
par: Liu, Yiyong, et autres
Publié: (2026)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
Interpretable LLM Guardrails via Sparse Representation Steering
par: He, Zeqing, et autres
Publié: (2025)
par: He, Zeqing, et autres
Publié: (2025)
Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
par: Pramanik, Vishal, et autres
Publié: (2026)
par: Pramanik, Vishal, et autres
Publié: (2026)
Adaptive Probe-based Steering for Robust LLM Jailbreaking
par: Chen, Junxi, et autres
Publié: (2026)
par: Chen, Junxi, et autres
Publié: (2026)
VulZoo: A Comprehensive Vulnerability Intelligence Dataset
par: Ruan, Bonan, et autres
Publié: (2024)
par: Ruan, Bonan, et autres
Publié: (2024)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
par: Zhang, Hongxiang, et autres
Publié: (2024)
par: Zhang, Hongxiang, et autres
Publié: (2024)
Cross-Modal Content Optimization for Steering Web Agent Preferences
par: Jiang, Tanqiu, et autres
Publié: (2025)
par: Jiang, Tanqiu, et autres
Publié: (2025)
ShallowJail: Steering Jailbreaks against Large Language Models
par: Liu, Shang, et autres
Publié: (2026)
par: Liu, Shang, et autres
Publié: (2026)
UniDetect: LLM-Driven Universal Fraud Detection across Heterogeneous Blockchains
par: Miao, Shuyi, et autres
Publié: (2026)
par: Miao, Shuyi, et autres
Publié: (2026)
Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights
par: Almalky, Abeer Matar A., et autres
Publié: (2025)
par: Almalky, Abeer Matar A., et autres
Publié: (2025)
Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
par: Chen, Luoyu, et autres
Publié: (2026)
par: Chen, Luoyu, et autres
Publié: (2026)
A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors
par: Xu, Zhenyu, et autres
Publié: (2026)
par: Xu, Zhenyu, et autres
Publié: (2026)
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
par: Lu, Weikai, et autres
Publié: (2025)
par: Lu, Weikai, et autres
Publié: (2025)
When MCP Servers Attack: Taxonomy, Feasibility, and Mitigation
par: Zhao, Weibo, et autres
Publié: (2025)
par: Zhao, Weibo, et autres
Publié: (2025)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
par: Hsu, Chia-Yi, et autres
Publié: (2026)
par: Hsu, Chia-Yi, et autres
Publié: (2026)
On Reasoning Strength Planning in Large Reasoning Models
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations
par: Collu, Matteo Gioele, et autres
Publié: (2026)
par: Collu, Matteo Gioele, et autres
Publié: (2026)
KernJC: Automated Vulnerable Environment Generation for Linux Kernel Vulnerabilities
par: Ruan, Bonan, et autres
Publié: (2024)
par: Ruan, Bonan, et autres
Publié: (2024)
Evaluating Disassembly Errors With Only Binaries
par: Wijayadi, Lambang Akbar, et autres
Publié: (2025)
par: Wijayadi, Lambang Akbar, et autres
Publié: (2025)
Towards Principled Analysis and Mitigation of Space Cyber Risks
par: Ear, Ekzhin
Publié: (2025)
par: Ear, Ekzhin
Publié: (2025)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
par: Wang, Linlin, et autres
Publié: (2025)
par: Wang, Linlin, et autres
Publié: (2025)
LLMs Can Unlearn Refusal with Only 1,000 Benign Samples
par: Guo, Yangyang, et autres
Publié: (2026)
par: Guo, Yangyang, et autres
Publié: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
PsyScam: A Benchmark for Psychological Techniques in Real-World Scams
par: Ma, Shang, et autres
Publié: (2025)
par: Ma, Shang, et autres
Publié: (2025)
Signals and Symptoms: ICS Attack Dataset From Railway Cyber Range
par: Yusof, Anis, et autres
Publié: (2025)
par: Yusof, Anis, et autres
Publié: (2025)
Fuzzing the PHP Interpreter via Dataflow Fusion
par: Jiang, Yuancheng, et autres
Publié: (2024)
par: Jiang, Yuancheng, et autres
Publié: (2024)
Documents similaires
-
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
par: Zhao, Weixiang, et autres
Publié: (2025) -
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
par: Yin, Rui, et autres
Publié: (2026) -
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
par: Zhang, Yi, et autres
Publié: (2025) -
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
par: Lin, Weilin, et autres
Publié: (2025) -
MASKDROID: Robust Android Malware Detection with Masked Graph Representations
par: Zheng, Jingnan, et autres
Publié: (2024)