Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Rui, Zhou, Yuhao, Xi, Zhiheng, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
Differentially Private Subspace Fine-Tuning for Large Language Models
par: Zheng, Lele, et autres
Publié: (2026)
par: Zheng, Lele, et autres
Publié: (2026)
FedBAP: Backdoor Defense via Benign Adversarial Perturbation in Federated Learning
par: Yan, Xinhai, et autres
Publié: (2025)
par: Yan, Xinhai, et autres
Publié: (2025)
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
par: Yang, Jirui, et autres
Publié: (2025)
par: Yang, Jirui, et autres
Publié: (2025)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)
par: Brown, Hannah, et autres
Publié: (2024)
Saliency Attention and Semantic Similarity-Driven Adversarial Perturbation
par: Waghela, Hetvi, et autres
Publié: (2024)
par: Waghela, Hetvi, et autres
Publié: (2024)
IDEA: Invariant Defense for Graph Adversarial Robustness
par: Tao, Shuchang, et autres
Publié: (2023)
par: Tao, Shuchang, et autres
Publié: (2023)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
par: Lou, Qian, et autres
Publié: (2024)
par: Lou, Qian, et autres
Publié: (2024)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
par: Li, Tung-Ling, et autres
Publié: (2025)
par: Li, Tung-Ling, et autres
Publié: (2025)
Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States
par: Chia, Xin Wei, et autres
Publié: (2025)
par: Chia, Xin Wei, et autres
Publié: (2025)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
par: Zhu, JianHao, et autres
Publié: (2024)
par: Zhu, JianHao, et autres
Publié: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Hijacking Large Language Models via Adversarial In-Context Learning
par: Zhou, Xiangyu, et autres
Publié: (2023)
par: Zhou, Xiangyu, et autres
Publié: (2023)
Adversarial Decoding: Generating Readable Documents for Adversarial Objectives
par: Zhang, Collin, et autres
Publié: (2024)
par: Zhang, Collin, et autres
Publié: (2024)
Low Rank Adaptation for Adversarial Perturbation
par: Liu, Han, et autres
Publié: (2026)
par: Liu, Han, et autres
Publié: (2026)
Combining Machine Learning Defenses without Conflicts
par: Duddu, Vasisht, et autres
Publié: (2024)
par: Duddu, Vasisht, et autres
Publié: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
PECAN: A Deterministic Certified Defense Against Backdoor Attacks
par: Zhang, Yuhao, et autres
Publié: (2023)
par: Zhang, Yuhao, et autres
Publié: (2023)
Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace
par: Yang, Jinluan, et autres
Publié: (2024)
par: Yang, Jinluan, et autres
Publié: (2024)
MIST: Defending Against Membership Inference Attacks Through Membership-Invariant Subspace Training
par: Li, Jiacheng, et autres
Publié: (2023)
par: Li, Jiacheng, et autres
Publié: (2023)
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
par: Zhang, Fangyuan, et autres
Publié: (2024)
par: Zhang, Fangyuan, et autres
Publié: (2024)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
par: Kim, Taeyoun, et autres
Publié: (2024)
par: Kim, Taeyoun, et autres
Publié: (2024)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
par: Sun, Bowen, et autres
Publié: (2026)
par: Sun, Bowen, et autres
Publié: (2026)
Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing
par: Xin, Yuan, et autres
Publié: (2023)
par: Xin, Yuan, et autres
Publié: (2023)
A Defensive Framework Against Adversarial Attacks on Machine Learning-Based Network Intrusion Detection Systems
par: Tafreshian, Benyamin, et autres
Publié: (2025)
par: Tafreshian, Benyamin, et autres
Publié: (2025)
From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
par: Zhang, Xinyu, et autres
Publié: (2023)
par: Zhang, Xinyu, et autres
Publié: (2023)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
Humanizing Machine-Generated Content: Evading AI-Text Detection through Adversarial Attack
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
Data-centric NLP Backdoor Defense from the Lens of Memorization
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
A No-Defense Defense Against Gradient-Based Adversarial Attacks on ML-NIDS: Is Less More?
par: elShehaby, Mohamed, et autres
Publié: (2026)
par: elShehaby, Mohamed, et autres
Publié: (2026)
Adversarial Suffix Filtering: a Defense Pipeline for LLMs
par: Khachaturov, David, et autres
Publié: (2025)
par: Khachaturov, David, et autres
Publié: (2025)
Enhancing the "Immunity" of Mixture-of-Experts Networks for Adversarial Defense
par: Han, Qiao, et autres
Publié: (2024)
par: Han, Qiao, et autres
Publié: (2024)
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
par: Zeng, Rui, et autres
Publié: (2024)
par: Zeng, Rui, et autres
Publié: (2024)
How Vulnerable Is My Learned Policy? Universal Adversarial Perturbation Attacks On Modern Behavior Cloning Policies
par: Kalra, Akansha, et autres
Publié: (2025)
par: Kalra, Akansha, et autres
Publié: (2025)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Test-time Adversarial Defense with Opposite Adversarial Path and High Attack Time Cost
par: Yeh, Cheng-Han, et autres
Publié: (2024)
par: Yeh, Cheng-Han, et autres
Publié: (2024)
One Stone, Two Birds: Enhancing Adversarial Defense Through the Lens of Distributional Discrepancy
par: Zhang, Jiacheng, et autres
Publié: (2025)
par: Zhang, Jiacheng, et autres
Publié: (2025)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
par: Kim, Heegyu, et autres
Publié: (2024)
par: Kim, Heegyu, et autres
Publié: (2024)
Documents similaires
-
CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling
par: Zhang, Kaiyuan, et autres
Publié: (2025) -
Differentially Private Subspace Fine-Tuning for Large Language Models
par: Zheng, Lele, et autres
Publié: (2026) -
FedBAP: Backdoor Defense via Benign Adversarial Perturbation in Federated Learning
par: Yan, Xinhai, et autres
Publié: (2025) -
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
par: Yang, Jirui, et autres
Publié: (2025) -
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)