Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Jiaming, Jiang, Wenbo, Hou, Guanyu, Fan, Wenshu, Zhang, Rui, Li, Hongwei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Stealthy Targeted Backdoor Attacks against Image Captioning
par: Fan, Wenshu, et autres
Publié: (2024)
par: Fan, Wenshu, et autres
Publié: (2024)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
MPMA: Preference Manipulation Attack Against Model Context Protocol
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Backdoor Attacks against Image-to-Image Networks
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
par: Wang, Zihan, et autres
Publié: (2026)
par: Wang, Zihan, et autres
Publié: (2026)
Invisibility Cloak: Disappearance under Human Pose Estimation via Backdoor Attacks
par: Zhang, Minxing, et autres
Publié: (2024)
par: Zhang, Minxing, et autres
Publié: (2024)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
Instruction Backdoor Attacks Against Customized LLMs
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
par: Wen, Rui, et autres
Publié: (2026)
par: Wen, Rui, et autres
Publié: (2026)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
par: Li, Ziqiang, et autres
Publié: (2024)
par: Li, Ziqiang, et autres
Publié: (2024)
Watch Out for the Lifespan: Evaluating Backdoor Attacks Against Federated Model Adaptation
par: Vuillod, Bastien, et autres
Publié: (2025)
par: Vuillod, Bastien, et autres
Publié: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
par: Wei, Jiali, et autres
Publié: (2026)
par: Wei, Jiali, et autres
Publié: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
par: Zhang, Rui, et autres
Publié: (2025)
par: Zhang, Rui, et autres
Publié: (2025)
Denial-of-Service Poisoning Attacks against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)
par: Chaudhari, Harsh, et autres
Publié: (2024)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
par: Tong, Yao, et autres
Publié: (2024)
par: Tong, Yao, et autres
Publié: (2024)
Watch the Watcher! Backdoor Attacks on Security-Enhancing Diffusion Models
par: Li, Changjiang, et autres
Publié: (2024)
par: Li, Changjiang, et autres
Publié: (2024)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
par: Wu, Zhengxian, et autres
Publié: (2025)
par: Wu, Zhengxian, et autres
Publié: (2025)
Data Extraction Attacks in Retrieval-Augmented Generation via Backdoors
par: Peng, Yuefeng, et autres
Publié: (2024)
par: Peng, Yuefeng, et autres
Publié: (2024)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
par: He, Yu, et autres
Publié: (2025)
par: He, Yu, et autres
Publié: (2025)
Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
par: Chen, Tianxin, et autres
Publié: (2026)
par: Chen, Tianxin, et autres
Publié: (2026)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025)
par: Xue, Eric, et autres
Publié: (2025)
On the Out-of-Distribution Backdoor Attack for Federated Learning
par: Xu, Jiahao, et autres
Publié: (2025)
par: Xu, Jiahao, et autres
Publié: (2025)
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
par: Cheng, Pengzhou, et autres
Publié: (2024)
par: Cheng, Pengzhou, et autres
Publié: (2024)
FORAY: Towards Effective Attack Synthesis against Deep Logical Vulnerabilities in DeFi Protocols
par: Wen, Hongbo, et autres
Publié: (2024)
par: Wen, Hongbo, et autres
Publié: (2024)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
DETOUR: A Practical Backdoor Attack against Object Detection
par: Liu, Dazhuang, et autres
Publié: (2026)
par: Liu, Dazhuang, et autres
Publié: (2026)
Defending against Backdoor Attacks via Module Switching
par: Li, Weijun, et autres
Publié: (2025)
par: Li, Weijun, et autres
Publié: (2025)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
Task-Agnostic Detector for Insertion-Based Backdoor Attacks
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
Documents similaires
-
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
par: Wang, Zihan, et autres
Publié: (2025) -
Stealthy Targeted Backdoor Attacks against Image Captioning
par: Fan, Wenshu, et autres
Publié: (2024) -
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025) -
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
par: Guo, Ji, et autres
Publié: (2024) -
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024)