CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Rui, Chen, Xi, Pu, Yuwen, Zhang, Xuhong, Du, Tianyu, Ji, Shouling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hijack Vertical Federated Learning Models As One Party
por: Qiu, Pengyu, et al.
Publicado: (2022)
por: Qiu, Pengyu, et al.
Publicado: (2022)
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
por: Ma, Oubo, et al.
Publicado: (2025)
por: Ma, Oubo, et al.
Publicado: (2025)
Data-centric NLP Backdoor Defense from the Lens of Memorization
por: Wang, Zhenting, et al.
Publicado: (2024)
por: Wang, Zhenting, et al.
Publicado: (2024)
"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning
por: Zhang, Jiale, et al.
Publicado: (2024)
por: Zhang, Jiale, et al.
Publicado: (2024)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
por: Zhang, Mingxuan, et al.
Publicado: (2025)
por: Zhang, Mingxuan, et al.
Publicado: (2025)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
por: Qiu, Pengyu, et al.
Publicado: (2022)
por: Qiu, Pengyu, et al.
Publicado: (2022)
Poison in the Well: Feature Embedding Disruption in Backdoor Attacks
por: Feng, Zhou, et al.
Publicado: (2025)
por: Feng, Zhou, et al.
Publicado: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
por: Xue, Eric, et al.
Publicado: (2025)
por: Xue, Eric, et al.
Publicado: (2025)
Reformulation is All You Need: Addressing Malicious Text Features in DNNs
por: Jiang, Yi, et al.
Publicado: (2025)
por: Jiang, Yi, et al.
Publicado: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
por: Liang, Jiacheng, et al.
Publicado: (2024)
por: Liang, Jiacheng, et al.
Publicado: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
por: He, Jiaming, et al.
Publicado: (2024)
por: He, Jiaming, et al.
Publicado: (2024)
SUB-PLAY: Adversarial Policies against Partially Observed Multi-Agent Reinforcement Learning Systems
por: Ma, Oubo, et al.
Publicado: (2024)
por: Ma, Oubo, et al.
Publicado: (2024)
Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning
por: Ma, Oubo, et al.
Publicado: (2026)
por: Ma, Oubo, et al.
Publicado: (2026)
Composite Backdoor Attacks Against Large Language Models
por: Huang, Hai, et al.
Publicado: (2023)
por: Huang, Hai, et al.
Publicado: (2023)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
por: Yin, Rui, et al.
Publicado: (2026)
por: Yin, Rui, et al.
Publicado: (2026)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
por: Zhang, Jiale, et al.
Publicado: (2025)
por: Zhang, Jiale, et al.
Publicado: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
por: Yan, Jun, et al.
Publicado: (2023)
por: Yan, Jun, et al.
Publicado: (2023)
Dullahan: Stealthy Backdoor Attack against Without-Label-Sharing Split Learning
por: Pu, Yuwen, et al.
Publicado: (2024)
por: Pu, Yuwen, et al.
Publicado: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
Mellivora Capensis: A Backdoor-Free Training Framework on the Poisoned Dataset without Auxiliary Data
por: Pu, Yuwen, et al.
Publicado: (2024)
por: Pu, Yuwen, et al.
Publicado: (2024)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
por: Sivapiromrat, Sanhanat, et al.
Publicado: (2025)
por: Sivapiromrat, Sanhanat, et al.
Publicado: (2025)
STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio
por: Park, Seong-Gyu, et al.
Publicado: (2026)
por: Park, Seong-Gyu, et al.
Publicado: (2026)
LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing
por: Chen, Jiahao, et al.
Publicado: (2025)
por: Chen, Jiahao, et al.
Publicado: (2025)
Test-Time Backdoor Attacks on Multimodal Large Language Models
por: Lu, Dong, et al.
Publicado: (2024)
por: Lu, Dong, et al.
Publicado: (2024)
DP-MemArc: Differential Privacy Transfer Learning for Memory Efficient Language Models
por: Liu, Yanming, et al.
Publicado: (2024)
por: Liu, Yanming, et al.
Publicado: (2024)
Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
por: Yao, Duanyi, et al.
Publicado: (2026)
por: Yao, Duanyi, et al.
Publicado: (2026)
Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods
por: Dey, Roopkatha, et al.
Publicado: (2024)
por: Dey, Roopkatha, et al.
Publicado: (2024)
Securing Federated Learning against Backdoor Threats with Foundation Model Integration
por: Bi, Xiaohuan, et al.
Publicado: (2024)
por: Bi, Xiaohuan, et al.
Publicado: (2024)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
por: Min, Rui, et al.
Publicado: (2025)
por: Min, Rui, et al.
Publicado: (2025)
Weight space Detection of Backdoors in LoRA Adapters
por: Merenciano, David Puertolas, et al.
Publicado: (2026)
por: Merenciano, David Puertolas, et al.
Publicado: (2026)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
por: Chaudhari, Harsh, et al.
Publicado: (2024)
por: Chaudhari, Harsh, et al.
Publicado: (2024)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
por: Price, Sara, et al.
Publicado: (2024)
por: Price, Sara, et al.
Publicado: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
Defending against Adversarial Malware Attacks on ML-based Android Malware Detection Systems
por: He, Ping, et al.
Publicado: (2025)
por: He, Ping, et al.
Publicado: (2025)
AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
por: Wang, Yiming, et al.
Publicado: (2024)
por: Wang, Yiming, et al.
Publicado: (2024)
Instruction Backdoor Attacks Against Customized LLMs
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
On the Out-of-Distribution Backdoor Attack for Federated Learning
por: Xu, Jiahao, et al.
Publicado: (2025)
por: Xu, Jiahao, et al.
Publicado: (2025)
Defending against Backdoor Attack on Deep Neural Networks
por: Cheng, Hao, et al.
Publicado: (2020)
por: Cheng, Hao, et al.
Publicado: (2020)
Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits
por: Draguns, Andis, et al.
Publicado: (2024)
por: Draguns, Andis, et al.
Publicado: (2024)
WARDEN: Multi-Directional Backdoor Watermarks for Embedding-as-a-Service Copyright Protection
por: Shetty, Anudeex, et al.
Publicado: (2024)
por: Shetty, Anudeex, et al.
Publicado: (2024)
Ejemplares similares
-
Hijack Vertical Federated Learning Models As One Party
por: Qiu, Pengyu, et al.
Publicado: (2022) -
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
por: Ma, Oubo, et al.
Publicado: (2025) -
Data-centric NLP Backdoor Defense from the Lens of Memorization
por: Wang, Zhenting, et al.
Publicado: (2024) -
"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning
por: Zhang, Jiale, et al.
Publicado: (2024) -
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
por: Zhang, Mingxuan, et al.
Publicado: (2025)