Task-Agnostic Detector for Insertion-Based Backdoor Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lyu, Weimin, Lin, Xiao, Zheng, Songzhu, Pang, Lu, Ling, Haibin, Jha, Susmit, Chen, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Long-Tailed Backdoor Attack Using Dynamic Data Augmentation Operations
par: Pang, Lu, et autres
Publié: (2024)
par: Pang, Lu, et autres
Publié: (2024)
Test-Time Backdoor Attacks on Multimodal Large Language Models
par: Lu, Dong, et autres
Publié: (2024)
par: Lu, Dong, et autres
Publié: (2024)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
par: Wen, Rui, et autres
Publié: (2026)
par: Wen, Rui, et autres
Publié: (2026)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
CAPAA: Classifier-Agnostic Projector-Based Adversarial Attack
par: Li, Zhan, et autres
Publié: (2025)
par: Li, Zhan, et autres
Publié: (2025)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
par: Cheng, Pengzhou, et autres
Publié: (2024)
par: Cheng, Pengzhou, et autres
Publié: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Data Extraction Attacks in Retrieval-Augmented Generation via Backdoors
par: Peng, Yuefeng, et autres
Publié: (2024)
par: Peng, Yuefeng, et autres
Publié: (2024)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
par: Wu, Zhengxian, et autres
Publié: (2025)
par: Wu, Zhengxian, et autres
Publié: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
par: Li, Ziqiang, et autres
Publié: (2024)
par: Li, Ziqiang, et autres
Publié: (2024)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025)
par: Xue, Eric, et autres
Publié: (2025)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
par: Wei, Jiali, et autres
Publié: (2026)
par: Wei, Jiali, et autres
Publié: (2026)
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
par: Zhang, Xiaozhe, et autres
Publié: (2026)
par: Zhang, Xiaozhe, et autres
Publié: (2026)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
par: Wang, Tianchun, et autres
Publié: (2024)
par: Wang, Tianchun, et autres
Publié: (2024)
BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers
par: Xue, Jiaqi, et autres
Publié: (2024)
par: Xue, Jiaqi, et autres
Publié: (2024)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Claim-Guided Textual Backdoor Attack for Practical Applications
par: Song, Minkyoo, et autres
Publié: (2024)
par: Song, Minkyoo, et autres
Publié: (2024)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
Concept-Guided Backdoor Attack on Vision Language Models
par: Shen, Haoyu, et autres
Publié: (2025)
par: Shen, Haoyu, et autres
Publié: (2025)
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)
par: Chaudhari, Harsh, et autres
Publié: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
par: Du, Wei, et autres
Publié: (2023)
par: Du, Wei, et autres
Publié: (2023)
GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors
par: Meng, Wenlong, et autres
Publié: (2025)
par: Meng, Wenlong, et autres
Publié: (2025)
MBTSAD: Mitigating Backdoors in Language Models Based on Token Splitting and Attention Distillation
par: Ding, Yidong, et autres
Publié: (2025)
par: Ding, Yidong, et autres
Publié: (2025)
PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-Rails
par: Mangaokar, Neal, et autres
Publié: (2024)
par: Mangaokar, Neal, et autres
Publié: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
par: Dong, Yiting, et autres
Publié: (2024)
par: Dong, Yiting, et autres
Publié: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
BadActs: A Universal Backdoor Defense in the Activation Space
par: Yi, Biao, et autres
Publié: (2024)
par: Yi, Biao, et autres
Publié: (2024)
Privacy Preserving In-Context-Learning Framework for Large Language Models
par: Bhusal, Bishnu, et autres
Publié: (2025)
par: Bhusal, Bishnu, et autres
Publié: (2025)
MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors
par: Li, Yuanfan, et autres
Publié: (2026)
par: Li, Yuanfan, et autres
Publié: (2026)
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
par: Li, Junxian, et autres
Publié: (2025)
par: Li, Junxian, et autres
Publié: (2025)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
par: Li, Bangxin, et autres
Publié: (2024)
par: Li, Bangxin, et autres
Publié: (2024)
Documents similaires
-
Long-Tailed Backdoor Attack Using Dynamic Data Augmentation Operations
par: Pang, Lu, et autres
Publié: (2024) -
Test-Time Backdoor Attacks on Multimodal Large Language Models
par: Lu, Dong, et autres
Publié: (2024) -
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
par: Wen, Rui, et autres
Publié: (2026) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024) -
CAPAA: Classifier-Agnostic Projector-Based Adversarial Attack
par: Li, Zhan, et autres
Publié: (2025)