Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning
Fuente:
arXiv
Saved in:
| Main Authors: | Bouaziz, Wassim, Videau, Mathurin, Usunier, Nicolas, El-Mhamdi, El-Mahdi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Inverting Gradient Attacks Makes Powerful Data Poisoning
by: Bouaziz, Wassim, et al.
Published: (2024)
by: Bouaziz, Wassim, et al.
Published: (2024)
Data Taggants: Dataset Ownership Verification via Harmless Targeted Data Poisoning
by: Bouaziz, Wassim, et al.
Published: (2024)
by: Bouaziz, Wassim, et al.
Published: (2024)
Targeted Data Poisoning for Black-Box Audio Datasets Ownership Verification
by: Bouaziz, Wassim, et al.
Published: (2025)
by: Bouaziz, Wassim, et al.
Published: (2025)
Approaching the Harm of Gradient Attacks While Only Flipping Labels
by: El-Kabid, Abdessamad, et al.
Published: (2025)
by: El-Kabid, Abdessamad, et al.
Published: (2025)
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
by: Wen, Yuxin, et al.
Published: (2024)
by: Wen, Yuxin, et al.
Published: (2024)
Hiding Backdoors within Event Sequence Data via Poisoning Attacks
by: Ermilova, Alina, et al.
Published: (2023)
by: Ermilova, Alina, et al.
Published: (2023)
Backdoor Learning Curves: Explaining Backdoor Poisoning Beyond Influence Functions
by: Cinà, Antonio Emanuele, et al.
Published: (2021)
by: Cinà, Antonio Emanuele, et al.
Published: (2021)
Provable Robustness of (Graph) Neural Networks Against Data Poisoning and Backdoor Attacks
by: Gosch, Lukas, et al.
Published: (2024)
by: Gosch, Lukas, et al.
Published: (2024)
Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models
by: Chaudhari, Harsh, et al.
Published: (2026)
by: Chaudhari, Harsh, et al.
Published: (2026)
State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
by: Guo, Ji, et al.
Published: (2026)
by: Guo, Ji, et al.
Published: (2026)
Indiscriminate Data Poisoning Attacks on Pre-trained Feature Extractors
by: Lu, Yiwei, et al.
Published: (2024)
by: Lu, Yiwei, et al.
Published: (2024)
Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning
by: Churina, Svetlana, et al.
Published: (2025)
by: Churina, Svetlana, et al.
Published: (2025)
The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models
by: Tan, Yuting, et al.
Published: (2025)
by: Tan, Yuting, et al.
Published: (2025)
Concealing Backdoor Model Updates in Federated Learning by Trigger-Optimized Data Poisoning
by: Zhang, Yujie, et al.
Published: (2024)
by: Zhang, Yujie, et al.
Published: (2024)
Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training
by: Labiad, Ismail, et al.
Published: (2025)
by: Labiad, Ismail, et al.
Published: (2025)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
by: Kong, Cong, et al.
Published: (2024)
by: Kong, Cong, et al.
Published: (2024)
Graph-Aware Stealthy Poison-Text Backdoors for Text-Attributed Graphs
by: Luo, Qi, et al.
Published: (2026)
by: Luo, Qi, et al.
Published: (2026)
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
by: Panaitescu-Liess, Michael-Andrei, et al.
Published: (2025)
by: Panaitescu-Liess, Michael-Andrei, et al.
Published: (2025)
Model Supply Chain Poisoning: Backdooring Pre-trained Models via Embedding Indistinguishability
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
SleeperNets: Universal Backdoor Poisoning Attacks Against Reinforcement Learning Agents
by: Rathbun, Ethan, et al.
Published: (2024)
by: Rathbun, Ethan, et al.
Published: (2024)
Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets
by: Zhang, Yechao, et al.
Published: (2025)
by: Zhang, Yechao, et al.
Published: (2025)
Poison with Style: A Practical Poisoning Attack on Code Large Language Models
by: Tran, Khang, et al.
Published: (2026)
by: Tran, Khang, et al.
Published: (2026)
Beyond Training-time Poisoning: Component-level and Post-training Backdoors in Deep Reinforcement Learning
by: Vyas, Sanyam, et al.
Published: (2025)
by: Vyas, Sanyam, et al.
Published: (2025)
Backdooring Masked Diffusion Language Models
by: Cao, Daniel Yiming, et al.
Published: (2026)
by: Cao, Daniel Yiming, et al.
Published: (2026)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
by: Sivapiromrat, Sanhanat, et al.
Published: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
by: Xue, Eric, et al.
Published: (2025)
by: Xue, Eric, et al.
Published: (2025)
Fusing Pruned and Backdoored Models: Optimal Transport-based Data-free Backdoor Mitigation
by: Lin, Weilin, et al.
Published: (2024)
by: Lin, Weilin, et al.
Published: (2024)
Poisoning Web-Scale Training Datasets is Practical
by: Carlini, Nicholas, et al.
Published: (2023)
by: Carlini, Nicholas, et al.
Published: (2023)
Backdoor Federated Learning by Poisoning Backdoor-Critical Layers
by: Zhuang, Haomin, et al.
Published: (2023)
by: Zhuang, Haomin, et al.
Published: (2023)
Backdoor Attacks on Decentralised Post-Training
by: Ersoy, Oğuzhan, et al.
Published: (2026)
by: Ersoy, Oğuzhan, et al.
Published: (2026)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
by: Yao, Xin, et al.
Published: (2025)
by: Yao, Xin, et al.
Published: (2025)
PCAP-Backdoor: Backdoor Poisoning Generator for Network Traffic in CPS/IoT Environments
by: Chathoth, Ajesh Koyatan, et al.
Published: (2025)
by: Chathoth, Ajesh Koyatan, et al.
Published: (2025)
Adaptive and Robust Data Poisoning Detection and Sanitization in Wearable IoT Systems using Large Language Models
by: Mithsara, W. K. M, et al.
Published: (2025)
by: Mithsara, W. K. M, et al.
Published: (2025)
Privacy Backdoors: Stealing Data with Corrupted Pretrained Models
by: Feng, Shanglun, et al.
Published: (2024)
by: Feng, Shanglun, et al.
Published: (2024)
Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing
by: Grimes, Keltin, et al.
Published: (2024)
by: Grimes, Keltin, et al.
Published: (2024)
Provable Watermarking for Data Poisoning Attacks
by: Zhu, Yifan, et al.
Published: (2025)
by: Zhu, Yifan, et al.
Published: (2025)
CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning
by: Zhang, Jinghuai, et al.
Published: (2022)
by: Zhang, Jinghuai, et al.
Published: (2022)
A Systematic Review of Poisoning Attacks Against Large Language Models
by: Fendley, Neil, et al.
Published: (2025)
by: Fendley, Neil, et al.
Published: (2025)
Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models
by: Wan, Guangnian, et al.
Published: (2026)
by: Wan, Guangnian, et al.
Published: (2026)
Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits
by: Draguns, Andis, et al.
Published: (2024)
by: Draguns, Andis, et al.
Published: (2024)
Similar Items
-
Inverting Gradient Attacks Makes Powerful Data Poisoning
by: Bouaziz, Wassim, et al.
Published: (2024) -
Data Taggants: Dataset Ownership Verification via Harmless Targeted Data Poisoning
by: Bouaziz, Wassim, et al.
Published: (2024) -
Targeted Data Poisoning for Black-Box Audio Datasets Ownership Verification
by: Bouaziz, Wassim, et al.
Published: (2025) -
Approaching the Harm of Gradient Attacks While Only Flipping Labels
by: El-Kabid, Abdessamad, et al.
Published: (2025) -
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
by: Wen, Yuxin, et al.
Published: (2024)