Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Jun, Yadav, Vikas, Li, Shiyang, Chen, Lichang, Tang, Zheng, Wang, Hai, Srinivasan, Vijay, Ren, Xiang, Jin, Hongxia |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
par: Hossen, Md Imran, et autres
Publié: (2024)
par: Hossen, Md Imran, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
par: Clop, Cody, et autres
Publié: (2024)
par: Clop, Cody, et autres
Publié: (2024)
Rethinking Backdoor Detection Evaluation for Language Models
par: Yan, Jun, et autres
Publié: (2024)
par: Yan, Jun, et autres
Publié: (2024)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
par: Xiang, Zhen, et autres
Publié: (2024)
par: Xiang, Zhen, et autres
Publié: (2024)
Defending against Indirect Prompt Injection by Instruction Detection
par: Wen, Tongyu, et autres
Publié: (2025)
par: Wen, Tongyu, et autres
Publié: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
ProtegoFed: Backdoor-Free Federated Instruction Tuning with Interspersed Poisoned Data
par: Zhao, Haodong, et autres
Publié: (2026)
par: Zhao, Haodong, et autres
Publié: (2026)
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
Revisiting Backdoor Threat in Federated Instruction Tuning from a Signal Aggregation Perspective
par: Zhao, Haodong, et autres
Publié: (2026)
par: Zhao, Haodong, et autres
Publié: (2026)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
Evaluation of Prompt Injection Defenses in Large Language Models
par: Deep, Priyal, et autres
Publié: (2026)
par: Deep, Priyal, et autres
Publié: (2026)
AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
Krait: A Backdoor Attack Against Graph Prompt Tuning
par: Song, Ying, et autres
Publié: (2024)
par: Song, Ying, et autres
Publié: (2024)
Goal-guided Generative Prompt Injection Attack on Large Language Models
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
Robust Anti-Backdoor Instruction Tuning in LVLMs
par: Xun, Yuan, et autres
Publié: (2025)
par: Xun, Yuan, et autres
Publié: (2025)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
par: Ni, Zhenyang, et autres
Publié: (2024)
par: Ni, Zhenyang, et autres
Publié: (2024)
AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks
par: Jia, Yuqi, et autres
Publié: (2026)
par: Jia, Yuqi, et autres
Publié: (2026)
DRIP: Defending Prompt Injection via Token-wise Representation Editing and Residual Instruction Fusion
par: Liu, Ruofan, et autres
Publié: (2025)
par: Liu, Ruofan, et autres
Publié: (2025)
XuanJia: A Comprehensive Virtualization-Based Code Obfuscator for Binary Protection
par: Zou, Xianyu, et autres
Publié: (2026)
par: Zou, Xianyu, et autres
Publié: (2026)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023)
par: Cao, Yuanpu, et autres
Publié: (2023)
Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization
par: Verma, Ishaan, et autres
Publié: (2025)
par: Verma, Ishaan, et autres
Publié: (2025)
ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs
par: Yan, Lu, et autres
Publié: (2024)
par: Yan, Lu, et autres
Publié: (2024)
Injection, Attack and Erasure: Revocable Backdoor Attacks via Machine Unlearning
par: Song, Baogang, et autres
Publié: (2025)
par: Song, Baogang, et autres
Publié: (2025)
A Novel Evaluation Framework for Assessing Resilience Against Prompt Injection Attacks in Large Language Models
par: Yip, Daniel Wankit, et autres
Publié: (2024)
par: Yip, Daniel Wankit, et autres
Publié: (2024)
Prompt Injection as an Emerging Threat: Evaluating the Resilience of Large Language Models
par: Ganiuly, Daniyal, et autres
Publié: (2025)
par: Ganiuly, Daniyal, et autres
Publié: (2025)
AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models
par: Wang, Jackson
Publié: (2026)
par: Wang, Jackson
Publié: (2026)
Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks
par: Collu, Matteo Gioele, et autres
Publié: (2025)
par: Collu, Matteo Gioele, et autres
Publié: (2025)
PromptShield: Deployable Detection for Prompt Injection Attacks
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
par: Wang, Runhe, et autres
Publié: (2026)
par: Wang, Runhe, et autres
Publié: (2026)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection
par: Ren, Junyu, et autres
Publié: (2026)
par: Ren, Junyu, et autres
Publié: (2026)
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
par: Lu, Weikai, et autres
Publié: (2025)
par: Lu, Weikai, et autres
Publié: (2025)
Prompt Injection Attacks on Large Language Models in Oncology
par: Clusmann, Jan, et autres
Publié: (2024)
par: Clusmann, Jan, et autres
Publié: (2024)
Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding
par: Pathade, Chetan
Publié: (2025)
par: Pathade, Chetan
Publié: (2025)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
par: Fu, Hang, et autres
Publié: (2026)
par: Fu, Hang, et autres
Publié: (2026)
Transferring Backdoors between Large Language Models by Knowledge Distillation
par: Cheng, Pengzhou, et autres
Publié: (2024)
par: Cheng, Pengzhou, et autres
Publié: (2024)
On the Adversarial Robustness of Instruction-Tuned Large Language Models for Code
par: Hossen, Md Imran, et autres
Publié: (2024)
par: Hossen, Md Imran, et autres
Publié: (2024)
Documents similaires
-
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
par: Hossen, Md Imran, et autres
Publié: (2024) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023) -
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
par: Clop, Cody, et autres
Publié: (2024) -
Rethinking Backdoor Detection Evaluation for Language Models
par: Yan, Jun, et autres
Publié: (2024) -
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
par: Chen, Yulin, et autres
Publié: (2025)