Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Zhiyuan, Abaimov, Stanislav, Gardiner, Joseph, Belguith, Sana |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models
by: Xu, Zhiyuan, et al.
Published: (2025)
by: Xu, Zhiyuan, et al.
Published: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
by: Xiong, Chen, et al.
Published: (2026)
by: Xiong, Chen, et al.
Published: (2026)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
by: Wang, Haoran, et al.
Published: (2023)
by: Wang, Haoran, et al.
Published: (2023)
Blockchain Amplification Attack
by: Tsuchiya, Taro, et al.
Published: (2024)
by: Tsuchiya, Taro, et al.
Published: (2024)
Toward Efficient Inference Attacks: Shadow Model Sharing via Mixture-of-Experts
by: Bai, Li, et al.
Published: (2025)
by: Bai, Li, et al.
Published: (2025)
Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes
by: Lin, Zilong, et al.
Published: (2025)
by: Lin, Zilong, et al.
Published: (2025)
Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion Attack
by: Dai, Chenxi, et al.
Published: (2025)
by: Dai, Chenxi, et al.
Published: (2025)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
by: Zhang, Shenyi, et al.
Published: (2025)
by: Zhang, Shenyi, et al.
Published: (2025)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
by: Yuan, Zenghui, et al.
Published: (2025)
by: Yuan, Zenghui, et al.
Published: (2025)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
by: Yin, Rui, et al.
Published: (2026)
by: Yin, Rui, et al.
Published: (2026)
From Storage to Steering: Memory Control Flow Attacks on LLM Agents
by: Xu, Zhenlin, et al.
Published: (2026)
by: Xu, Zhenlin, et al.
Published: (2026)
Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
by: Raza, Ali, et al.
Published: (2026)
by: Raza, Ali, et al.
Published: (2026)
Defending Large Language Models Against Attacks With Residual Stream Activation Analysis
by: Kawasaki, Amelia, et al.
Published: (2024)
by: Kawasaki, Amelia, et al.
Published: (2024)
Building an Open Source Operational Technology Pentesting Platform: Lessons from LINICS
by: Rashid, Awais, et al.
Published: (2026)
by: Rashid, Awais, et al.
Published: (2026)
A Survey of Attacks on Large Language Models
by: Xu, Wenrui, et al.
Published: (2025)
by: Xu, Wenrui, et al.
Published: (2025)
Layer-Targeted Multilingual Knowledge Erasure in Large Language Models
by: Li, Taoran, et al.
Published: (2026)
by: Li, Taoran, et al.
Published: (2026)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
by: Zeng, Xiyu, et al.
Published: (2025)
by: Zeng, Xiyu, et al.
Published: (2025)
RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs
by: Xu, Zhiyuan, et al.
Published: (2026)
by: Xu, Zhiyuan, et al.
Published: (2026)
System Prompt Extraction Attacks and Defenses in Large Language Models
by: Das, Badhan Chandra, et al.
Published: (2025)
by: Das, Badhan Chandra, et al.
Published: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
by: Fu, Hang, et al.
Published: (2026)
by: Fu, Hang, et al.
Published: (2026)
Membership Inference Attacks Against Video Large Language Models
by: Song, Wei, et al.
Published: (2026)
by: Song, Wei, et al.
Published: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
by: Zhao, Jiawei, et al.
Published: (2024)
by: Zhao, Jiawei, et al.
Published: (2024)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
by: Chen, Zeyuan, et al.
Published: (2026)
by: Chen, Zeyuan, et al.
Published: (2026)
ShallowJail: Steering Jailbreaks against Large Language Models
by: Liu, Shang, et al.
Published: (2026)
by: Liu, Shang, et al.
Published: (2026)
Shadow-Free Membership Inference Attacks: Recommender Systems Are More Vulnerable Than You Thought
by: Chi, Xiaoxiao, et al.
Published: (2024)
by: Chi, Xiaoxiao, et al.
Published: (2024)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
by: Weng, Fenghua, et al.
Published: (2024)
by: Weng, Fenghua, et al.
Published: (2024)
MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
by: Lintelo, Jona te, et al.
Published: (2026)
by: Lintelo, Jona te, et al.
Published: (2026)
Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
by: Zhu, Pengyu, et al.
Published: (2025)
by: Zhu, Pengyu, et al.
Published: (2025)
Large Language Model Adversarial Landscape Through the Lens of Attack Objectives
by: Wang, Nan, et al.
Published: (2025)
by: Wang, Nan, et al.
Published: (2025)
Prompt Inference Attack on Distributed Large Language Model Inference Frameworks
by: Luo, Xinjian, et al.
Published: (2025)
by: Luo, Xinjian, et al.
Published: (2025)
Prompt Inversion Attack against Collaborative Inference of Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
by: Yin, Ziyi, et al.
Published: (2025)
by: Yin, Ziyi, et al.
Published: (2025)
Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks
by: Peng, Benji, et al.
Published: (2024)
by: Peng, Benji, et al.
Published: (2024)
Counterfactual Explainable Incremental Prompt Attack Analysis on Large Language Models
by: Shu, Dong, et al.
Published: (2024)
by: Shu, Dong, et al.
Published: (2024)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
by: Lin, Weilin, et al.
Published: (2025)
by: Lin, Weilin, et al.
Published: (2025)
AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models
by: Wang, Jackson
Published: (2026)
by: Wang, Jackson
Published: (2026)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
by: Wang, Zihan, et al.
Published: (2026)
by: Wang, Zihan, et al.
Published: (2026)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
by: Nakka, Krishna Kanth, et al.
Published: (2025)
by: Nakka, Krishna Kanth, et al.
Published: (2025)
Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
by: Liu, Yiyong, et al.
Published: (2026)
by: Liu, Yiyong, et al.
Published: (2026)
Similar Items
-
The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models
by: Xu, Zhiyuan, et al.
Published: (2025) -
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
by: Xiong, Chen, et al.
Published: (2026) -
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
by: Wang, Haoran, et al.
Published: (2023) -
Blockchain Amplification Attack
by: Tsuchiya, Taro, et al.
Published: (2024) -
Toward Efficient Inference Attacks: Shadow Model Sharing via Mixture-of-Experts
by: Bai, Li, et al.
Published: (2025)