Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Raza, Ali, Gupta, Gurang, Matyunin, Nikolay, Patra, Jibesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies
par: Yuan, Haiyue, et autres
Publié: (2026)
par: Yuan, Haiyue, et autres
Publié: (2026)
Information Theoretic Adversarial Training of Large Language Models
par: Zhang, Yiwei, et autres
Publié: (2026)
par: Zhang, Yiwei, et autres
Publié: (2026)
Exploiting Layer-Specific Vulnerabilities to Backdoor Attack in Federated Learning
par: Foroughi, Mohammad Hadi, et autres
Publié: (2026)
par: Foroughi, Mohammad Hadi, et autres
Publié: (2026)
Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models
par: Panchigar, Praneel, et autres
Publié: (2026)
par: Panchigar, Praneel, et autres
Publié: (2026)
Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Input-Specific and Universal Adversarial Attack Generation for Spiking Neural Networks in the Spiking Domain
par: Raptis, Spyridon, et autres
Publié: (2025)
par: Raptis, Spyridon, et autres
Publié: (2025)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
par: Xiong, Chen, et autres
Publié: (2026)
par: Xiong, Chen, et autres
Publié: (2026)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
par: Liu, Fuqiang, et autres
Publié: (2024)
par: Liu, Fuqiang, et autres
Publié: (2024)
Large Language Models in Wireless Application Design: In-Context Learning-enhanced Automatic Network Intrusion Detection
par: Zhang, Han, et autres
Publié: (2024)
par: Zhang, Han, et autres
Publié: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
Watermark Stealing in Large Language Models
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
Privacy Auditing of Large Language Models
par: Panda, Ashwinee, et autres
Publié: (2025)
par: Panda, Ashwinee, et autres
Publié: (2025)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
par: Batra, Shourya, et autres
Publié: (2025)
par: Batra, Shourya, et autres
Publié: (2025)
Federated Foundation Models: Privacy-Preserving and Collaborative Learning for Large Models
par: Yu, Sixing, et autres
Publié: (2023)
par: Yu, Sixing, et autres
Publié: (2023)
Model-based Large Language Model Customization as Service
par: Wu, Zhaomin, et autres
Publié: (2024)
par: Wu, Zhaomin, et autres
Publié: (2024)
PRISM: Privacy-preserving Inference System with Homomorphic Encryption and Modular Activation
par: Elkhatib, Zeinab, et autres
Publié: (2025)
par: Elkhatib, Zeinab, et autres
Publié: (2025)
XG-NID: Dual-Modality Network Intrusion Detection using a Heterogeneous Graph Neural Network and Large Language Model
par: Farrukh, Yasir Ali, et autres
Publié: (2024)
par: Farrukh, Yasir Ali, et autres
Publié: (2024)
Shape and Substance: Dual-Layer Side-Channel Attacks on Local Vision-Language Models
par: Hadad, Eyal, et autres
Publié: (2026)
par: Hadad, Eyal, et autres
Publié: (2026)
RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models
par: Chugh, Rishit
Publié: (2026)
par: Chugh, Rishit
Publié: (2026)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
par: Peng, Benji, et autres
Publié: (2024)
par: Peng, Benji, et autres
Publié: (2024)
Exploring the Secondary Risks of Large Language Models
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Finetuning Large Language Models for Vulnerability Detection
par: Shestov, Alexey, et autres
Publié: (2024)
par: Shestov, Alexey, et autres
Publié: (2024)
Adversaries Can Misuse Combinations of Safe Models
par: Jones, Erik, et autres
Publié: (2024)
par: Jones, Erik, et autres
Publié: (2024)
Understanding the Effects of Safety Unalignment on Large Language Models
par: Halloran, John T.
Publié: (2026)
par: Halloran, John T.
Publié: (2026)
Prompt Injection Attacks on Large Language Models in Oncology
par: Clusmann, Jan, et autres
Publié: (2024)
par: Clusmann, Jan, et autres
Publié: (2024)
Towards Characterizing Cyber Networks with Large Language Models
par: Hartsock, Alaric, et autres
Publié: (2024)
par: Hartsock, Alaric, et autres
Publié: (2024)
Adaptive PII Mitigation Framework for Large Language Models
par: Asthana, Shubhi, et autres
Publié: (2025)
par: Asthana, Shubhi, et autres
Publié: (2025)
Large Language Models Are Unreliable for Cyber Threat Intelligence
par: Mezzi, Emanuele, et autres
Publié: (2025)
par: Mezzi, Emanuele, et autres
Publié: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
par: Zhao, Kaixiang, et autres
Publié: (2025)
par: Zhao, Kaixiang, et autres
Publié: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
par: Reddy, Aashray, et autres
Publié: (2025)
par: Reddy, Aashray, et autres
Publié: (2025)
Generating Adversarial Point Clouds Using Diffusion Model
par: Zhao, Ruiyang, et autres
Publié: (2025)
par: Zhao, Ruiyang, et autres
Publié: (2025)
Evaluating Large Language Models for Security Bug Report Prediction
par: Soltaniani, Farnaz, et autres
Publié: (2026)
par: Soltaniani, Farnaz, et autres
Publié: (2026)
Securing Large Language Models: Threats, Vulnerabilities and Responsible Practices
par: Abdali, Sara, et autres
Publié: (2024)
par: Abdali, Sara, et autres
Publié: (2024)
Permissioned LLMs: Enforcing Access Control in Large Language Models
par: Jayaraman, Bargav, et autres
Publié: (2025)
par: Jayaraman, Bargav, et autres
Publié: (2025)
Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques
par: Jaffal, Niveen O., et autres
Publié: (2025)
par: Jaffal, Niveen O., et autres
Publié: (2025)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
par: Wu, Linyu, et autres
Publié: (2025)
par: Wu, Linyu, et autres
Publié: (2025)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
par: Luan, Xiaokun, et autres
Publié: (2025)
par: Luan, Xiaokun, et autres
Publié: (2025)
Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
par: Beerens, Lucas, et autres
Publié: (2025)
par: Beerens, Lucas, et autres
Publié: (2025)
Documents similaires
-
LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies
par: Yuan, Haiyue, et autres
Publié: (2026) -
Information Theoretic Adversarial Training of Large Language Models
par: Zhang, Yiwei, et autres
Publié: (2026) -
Exploiting Layer-Specific Vulnerabilities to Backdoor Attack in Federated Learning
par: Foroughi, Mohammad Hadi, et autres
Publié: (2026) -
Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models
par: Panchigar, Praneel, et autres
Publié: (2026) -
Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning
par: Gloaguen, Thibaud, et autres
Publié: (2025)