Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Haoran, Chen, Yulin, Zheng, Zihao, Hu, Qi, Chan, Chunkit, Liu, Heshan, Song, Yangqiu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Privacy in Large Language Models: Attacks, Defenses and Future Directions
por: Li, Haoran, et al.
Publicado: (2023)
por: Li, Haoran, et al.
Publicado: (2023)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language Models
por: Li, Haoran, et al.
Publicado: (2023)
por: Li, Haoran, et al.
Publicado: (2023)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
por: Fan, Wei, et al.
Publicado: (2024)
por: Fan, Wei, et al.
Publicado: (2024)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Privacy Checklist: Privacy Violation Detection Grounding on Contextual Integrity Theory
por: Li, Haoran, et al.
Publicado: (2024)
por: Li, Haoran, et al.
Publicado: (2024)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
por: Li, Haoran, et al.
Publicado: (2024)
por: Li, Haoran, et al.
Publicado: (2024)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
por: Li, Ziqiang, et al.
Publicado: (2024)
por: Li, Ziqiang, et al.
Publicado: (2024)
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
por: Cheng, Pengzhou, et al.
Publicado: (2024)
por: Cheng, Pengzhou, et al.
Publicado: (2024)
TopicAttack: An Indirect Prompt Injection Attack via Topic Transition
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Privacy-Preserved Neural Graph Databases
por: Hu, Qi, et al.
Publicado: (2023)
por: Hu, Qi, et al.
Publicado: (2023)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Isolate Trigger: Detecting and Eliminating Adaptive Backdoor Attacks
por: Sun, Chengrui, et al.
Publicado: (2025)
por: Sun, Chengrui, et al.
Publicado: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
por: Yan, Jun, et al.
Publicado: (2023)
por: Yan, Jun, et al.
Publicado: (2023)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
por: Wu, Zongru, et al.
Publicado: (2024)
por: Wu, Zongru, et al.
Publicado: (2024)
Can Indirect Prompt Injection Attacks Be Detected and Removed?
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
Rethinking Backdoor Detection Evaluation for Language Models
por: Yan, Jun, et al.
Publicado: (2024)
por: Yan, Jun, et al.
Publicado: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
por: Cao, Yuanpu, et al.
Publicado: (2023)
por: Cao, Yuanpu, et al.
Publicado: (2023)
Composite Backdoor Attacks Against Large Language Models
por: Huang, Hai, et al.
Publicado: (2023)
por: Huang, Hai, et al.
Publicado: (2023)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models
por: Rachapudi, Jagadeesh, et al.
Publicado: (2026)
por: Rachapudi, Jagadeesh, et al.
Publicado: (2026)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
por: He, Jiaming, et al.
Publicado: (2024)
por: He, Jiaming, et al.
Publicado: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
por: Jiang, Peihai, et al.
Publicado: (2025)
por: Jiang, Peihai, et al.
Publicado: (2025)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
por: Wu, Zhengxian, et al.
Publicado: (2025)
por: Wu, Zhengxian, et al.
Publicado: (2025)
Cross-Modal Backdoors in Multimodal Large Language Models
por: Wang, Runhe, et al.
Publicado: (2026)
por: Wang, Runhe, et al.
Publicado: (2026)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
por: Hu, Man, et al.
Publicado: (2025)
por: Hu, Man, et al.
Publicado: (2025)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
por: Du, Wei, et al.
Publicado: (2023)
por: Du, Wei, et al.
Publicado: (2023)
Resource Consumption Red-Teaming for Large Vision-Language Models
por: Gao, Haoran, et al.
Publicado: (2025)
por: Gao, Haoran, et al.
Publicado: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
BadActs: A Universal Backdoor Defense in the Activation Space
por: Yi, Biao, et al.
Publicado: (2024)
por: Yi, Biao, et al.
Publicado: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
por: Xue, Eric, et al.
Publicado: (2025)
por: Xue, Eric, et al.
Publicado: (2025)
MBTSAD: Mitigating Backdoors in Language Models Based on Token Splitting and Attention Distillation
por: Ding, Yidong, et al.
Publicado: (2025)
por: Ding, Yidong, et al.
Publicado: (2025)
Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models
por: Fortier, Alexandrine, et al.
Publicado: (2025)
por: Fortier, Alexandrine, et al.
Publicado: (2025)
Task-Agnostic Detector for Insertion-Based Backdoor Attacks
por: Lyu, Weimin, et al.
Publicado: (2024)
por: Lyu, Weimin, et al.
Publicado: (2024)
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
por: Chen, Yulin, et al.
Publicado: (2026)
por: Chen, Yulin, et al.
Publicado: (2026)
Ejemplares similares
-
Privacy in Large Language Models: Attacks, Defenses and Future Directions
por: Li, Haoran, et al.
Publicado: (2023) -
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024) -
PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language Models
por: Li, Haoran, et al.
Publicado: (2023) -
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
por: Chen, Yulin, et al.
Publicado: (2025) -
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
por: Fan, Wei, et al.
Publicado: (2024)