The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Yuting, Huang, Yi, Li, Zhuo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Graph-Aware Stealthy Poison-Text Backdoors for Text-Attributed Graphs
by: Luo, Qi, et al.
Published: (2026)
by: Luo, Qi, et al.
Published: (2026)
State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
by: Guo, Ji, et al.
Published: (2026)
by: Guo, Ji, et al.
Published: (2026)
SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
by: Xu, Haotian, et al.
Published: (2025)
by: Xu, Haotian, et al.
Published: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
by: Xue, Eric, et al.
Published: (2025)
by: Xue, Eric, et al.
Published: (2025)
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
by: Xu, Yuancheng, et al.
Published: (2024)
by: Xu, Yuancheng, et al.
Published: (2024)
Stealthy and Adjustable Text-Guided Backdoor Attacks on Multimodal Pretrained Models
by: Zhang, Yiyang, et al.
Published: (2026)
by: Zhang, Yiyang, et al.
Published: (2026)
Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning
by: Bouaziz, Wassim, et al.
Published: (2025)
by: Bouaziz, Wassim, et al.
Published: (2025)
Backdoor Learning Curves: Explaining Backdoor Poisoning Beyond Influence Functions
by: Cinà, Antonio Emanuele, et al.
Published: (2021)
by: Cinà, Antonio Emanuele, et al.
Published: (2021)
Stealthy Yet Effective: Distribution-Preserving Backdoor Attacks on Graph Classification
by: Wang, Xiaobao, et al.
Published: (2025)
by: Wang, Xiaobao, et al.
Published: (2025)
Under-confidence Backdoors Are Resilient and Stealthy Backdoors
by: Peng, Minlong, et al.
Published: (2022)
by: Peng, Minlong, et al.
Published: (2022)
Poison with Style: A Practical Poisoning Attack on Code Large Language Models
by: Tran, Khang, et al.
Published: (2026)
by: Tran, Khang, et al.
Published: (2026)
Lurking in the shadows: Unveiling Stealthy Backdoor Attacks against Personalized Federated Learning
by: Lyu, Xiaoting, et al.
Published: (2024)
by: Lyu, Xiaoting, et al.
Published: (2024)
SDBA: A Stealthy and Long-Lasting Durable Backdoor Attack in Federated Learning
by: Choe, Minyeong, et al.
Published: (2024)
by: Choe, Minyeong, et al.
Published: (2024)
Differentially Private Subspace Fine-Tuning for Large Language Models
by: Zheng, Lele, et al.
Published: (2026)
by: Zheng, Lele, et al.
Published: (2026)
Stealthy Poisoning Attacks Bypass Defenses in Regression Settings
by: Carnerero-Cano, Javier, et al.
Published: (2026)
by: Carnerero-Cano, Javier, et al.
Published: (2026)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
by: Yan, Jun, et al.
Published: (2023)
by: Yan, Jun, et al.
Published: (2023)
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
by: Panaitescu-Liess, Michael-Andrei, et al.
Published: (2025)
by: Panaitescu-Liess, Michael-Andrei, et al.
Published: (2025)
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
by: Wen, Yuxin, et al.
Published: (2024)
by: Wen, Yuxin, et al.
Published: (2024)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
Adversarial Update-Based Federated Unlearning for Poisoned Model Recovery
by: Zhao, Wenwei, et al.
Published: (2026)
by: Zhao, Wenwei, et al.
Published: (2026)
GESR: Graph-Based Edge Semantic Reconstruction for Stealthy Communication Detection with Benign-Only Training
by: Xu, Henghui, et al.
Published: (2026)
by: Xu, Henghui, et al.
Published: (2026)
The Resurgence of GCG Adversarial Attacks on Large Language Models
by: Tan, Yuting, et al.
Published: (2025)
by: Tan, Yuting, et al.
Published: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
by: Xu, Jiashu, et al.
Published: (2023)
by: Xu, Jiashu, et al.
Published: (2023)
Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing
by: Grimes, Keltin, et al.
Published: (2024)
by: Grimes, Keltin, et al.
Published: (2024)
Hiding Backdoors within Event Sequence Data via Poisoning Attacks
by: Ermilova, Alina, et al.
Published: (2023)
by: Ermilova, Alina, et al.
Published: (2023)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
by: Xiang, Zhen, et al.
Published: (2024)
by: Xiang, Zhen, et al.
Published: (2024)
Backdooring Masked Diffusion Language Models
by: Cao, Daniel Yiming, et al.
Published: (2026)
by: Cao, Daniel Yiming, et al.
Published: (2026)
DP-SelFT: Differentially Private Selective Fine-Tuning for Large Language Models
by: Sha, Haichao, et al.
Published: (2026)
by: Sha, Haichao, et al.
Published: (2026)
A Systematic Review of Poisoning Attacks Against Large Language Models
by: Fendley, Neil, et al.
Published: (2025)
by: Fendley, Neil, et al.
Published: (2025)
SleeperNets: Universal Backdoor Poisoning Attacks Against Reinforcement Learning Agents
by: Rathbun, Ethan, et al.
Published: (2024)
by: Rathbun, Ethan, et al.
Published: (2024)
Provable Robustness of (Graph) Neural Networks Against Data Poisoning and Backdoor Attacks
by: Gosch, Lukas, et al.
Published: (2024)
by: Gosch, Lukas, et al.
Published: (2024)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
by: Huang, Yuan
Published: (2025)
by: Huang, Yuan
Published: (2025)
Backdoor Federated Learning by Poisoning Backdoor-Critical Layers
by: Zhuang, Haomin, et al.
Published: (2023)
by: Zhuang, Haomin, et al.
Published: (2023)
PrivTune: Efficient and Privacy-Preserving Fine-Tuning of Large Language Models via Device-Cloud Collaboration
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
Composite Backdoor Attacks Against Large Language Models
by: Huang, Hai, et al.
Published: (2023)
by: Huang, Hai, et al.
Published: (2023)
FuncPoison: Poisoning Function Library to Hijack Multi-agent Autonomous Driving Systems
by: Long, Yuzhen, et al.
Published: (2025)
by: Long, Yuzhen, et al.
Published: (2025)
Stealthy Adversarial Attacks on Stochastic Multi-Armed Bandits
by: Wang, Zhiwei, et al.
Published: (2024)
by: Wang, Zhiwei, et al.
Published: (2024)
In-Context Probing for Membership Inference in Fine-Tuned Language Models
by: Lu, Zhexi, et al.
Published: (2025)
by: Lu, Zhexi, et al.
Published: (2025)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
by: Zhang, Jiale, et al.
Published: (2025)
by: Zhang, Jiale, et al.
Published: (2025)
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
by: Zou, Wei, et al.
Published: (2024)
by: Zou, Wei, et al.
Published: (2024)
Similar Items
-
Graph-Aware Stealthy Poison-Text Backdoors for Text-Attributed Graphs
by: Luo, Qi, et al.
Published: (2026) -
State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
by: Guo, Ji, et al.
Published: (2026) -
SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
by: Xu, Haotian, et al.
Published: (2025) -
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
by: Xue, Eric, et al.
Published: (2025) -
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
by: Xu, Yuancheng, et al.
Published: (2024)