Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Luoyu, Wang, Weiqi, Tian, Zhiyi, Zhang, Chenhan, Wu, Feng, Huang, Jianhuan, Asiri, Ahmed, Yu, Shui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
par: Chen, Luoyu, et autres
Publié: (2026)
par: Chen, Luoyu, et autres
Publié: (2026)
Machine Unlearning: A Comprehensive Survey
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
SCU: An Efficient Machine Unlearning Scheme for Deep Learning Enabled Semantic Communications
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
CRFU: Compressive Representation Forgetting Against Privacy Leakage on Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
BlindU: Blind Machine Unlearning without Revealing Erasing Data
par: Wang, Weiqi, et autres
Publié: (2026)
par: Wang, Weiqi, et autres
Publié: (2026)
TAPE: Tailored Posterior Difference for Auditing of Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Refusal-Trained LLMs Are Easily Jailbroken As Browser Agents
par: Kumar, Priyanshu, et autres
Publié: (2024)
par: Kumar, Priyanshu, et autres
Publié: (2024)
Jailbroken Frontier Models Retain Their Capabilities
par: Zhu, Daniel, et autres
Publié: (2026)
par: Zhu, Daniel, et autres
Publié: (2026)
Defending Buffer Overflows in WebAssembly: A Transpiler Approach
par: Feng, Weiqi
Publié: (2026)
par: Feng, Weiqi
Publié: (2026)
EVE: Efficient Verification of Data Erasure through Customized Perturbation in Approximate Unlearning
par: Wang, Weiqi, et autres
Publié: (2026)
par: Wang, Weiqi, et autres
Publié: (2026)
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
par: Xiong, Chen, et autres
Publié: (2026)
par: Xiong, Chen, et autres
Publié: (2026)
MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
par: Lintelo, Jona te, et autres
Publié: (2026)
par: Lintelo, Jona te, et autres
Publié: (2026)
Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation
par: Heiding, Fred, et autres
Publié: (2025)
par: Heiding, Fred, et autres
Publié: (2025)
Security and Privacy Issues in Cloud Storage
par: Asiri, Norah
Publié: (2024)
par: Asiri, Norah
Publié: (2024)
A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares
par: Cohen, Stav, et autres
Publié: (2024)
par: Cohen, Stav, et autres
Publié: (2024)
Property-Preserving Hashing for $\ell_1$-Distance Predicates: Applications to Countering Adversarial Input Attacks
par: Asghar, Hassan, et autres
Publié: (2025)
par: Asghar, Hassan, et autres
Publié: (2025)
Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
par: Raza, Ali, et autres
Publié: (2026)
par: Raza, Ali, et autres
Publié: (2026)
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
par: Xu, Zhiyuan, et autres
Publié: (2025)
par: Xu, Zhiyuan, et autres
Publié: (2025)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
Federated TrustChain: Blockchain-Enhanced LLM Training and Unlearning
par: Zuo, Xuhan, et autres
Publié: (2024)
par: Zuo, Xuhan, et autres
Publié: (2024)
Limits of Residual-Based Detection for Physically Consistent False Data Injection
par: Xiao, Chenhan, et autres
Publié: (2026)
par: Xiao, Chenhan, et autres
Publié: (2026)
SwitchPatch: Physical Adversarial Attack Strategy with Switchable Adversarial Objectives
par: Jiang, Hanrui, et autres
Publié: (2025)
par: Jiang, Hanrui, et autres
Publié: (2025)
Enhancing Adversarial Transferability with Adversarial Weight Tuning
par: Chen, Jiahao, et autres
Publié: (2024)
par: Chen, Jiahao, et autres
Publié: (2024)
FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems
par: Li, Fanxiao, et autres
Publié: (2026)
par: Li, Fanxiao, et autres
Publié: (2026)
BAN: Detecting Backdoors Activated by Adversarial Neuron Noise
par: Xu, Xiaoyun, et autres
Publié: (2024)
par: Xu, Xiaoyun, et autres
Publié: (2024)
DUMB and DUMBer: Is Adversarial Training Worth It in the Real World?
par: Marchiori, Francesco, et autres
Publié: (2025)
par: Marchiori, Francesco, et autres
Publié: (2025)
Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
par: Liu, Yiyong, et autres
Publié: (2026)
par: Liu, Yiyong, et autres
Publié: (2026)
LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
par: Gong, Yuyang, et autres
Publié: (2026)
par: Gong, Yuyang, et autres
Publié: (2026)
Efficient Adversarial Detection Frameworks for Vehicle-to-Microgrid Services in Edge Computing
par: Omara, Ahmed, et autres
Publié: (2025)
par: Omara, Ahmed, et autres
Publié: (2025)
Dynamic Dual-level Defense Routing for Continual Adversarial Training
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Double-Adversarial Activation Anomaly Detection: Adversarial Autoencoders are Anomaly Generators
par: Schulze, J. -P., et autres
Publié: (2021)
par: Schulze, J. -P., et autres
Publié: (2021)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
par: Zeng, Xiyu, et autres
Publié: (2025)
par: Zeng, Xiyu, et autres
Publié: (2025)
Data Sharing, Privacy and Security Considerations in the Energy Sector: A Review from Technical Landscape to Regulatory Specifications
par: Zhang, Shiliang, et autres
Publié: (2025)
par: Zhang, Shiliang, et autres
Publié: (2025)
Adversarial Defenses via Vector Quantization
par: Dong, Zhiyi, et autres
Publié: (2023)
par: Dong, Zhiyi, et autres
Publié: (2023)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
par: Yin, Rui, et autres
Publié: (2026)
par: Yin, Rui, et autres
Publié: (2026)
CANEDERLI: On The Impact of Adversarial Training and Transferability on CAN Intrusion Detection Systems
par: Marchiori, Francesco, et autres
Publié: (2024)
par: Marchiori, Francesco, et autres
Publié: (2024)
Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion Attack
par: Dai, Chenxi, et autres
Publié: (2025)
par: Dai, Chenxi, et autres
Publié: (2025)
EthCluster: An Unsupervised Static Analysis Method for Ethereum Smart Contract
par: Huang, Hong-Sheng, et autres
Publié: (2025)
par: Huang, Hong-Sheng, et autres
Publié: (2025)
From Storage to Steering: Memory Control Flow Attacks on LLM Agents
par: Xu, Zhenlin, et autres
Publié: (2026)
par: Xu, Zhenlin, et autres
Publié: (2026)
Documents similaires
-
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
par: Chen, Luoyu, et autres
Publié: (2026) -
Machine Unlearning: A Comprehensive Survey
par: Wang, Weiqi, et autres
Publié: (2024) -
SCU: An Efficient Machine Unlearning Scheme for Deep Learning Enabled Semantic Communications
par: Wang, Weiqi, et autres
Publié: (2025) -
CRFU: Compressive Representation Forgetting Against Privacy Leakage on Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025) -
BlindU: Blind Machine Unlearning without Revealing Erasing Data
par: Wang, Weiqi, et autres
Publié: (2026)