Data-centric NLP Backdoor Defense from the Lens of Memorization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhenting, Wang, Zhizhi, Jin, Mingyu, Du, Mengnan, Zhai, Juan, Ma, Shiqing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
par: Zeng, Rui, et autres
Publié: (2024)
par: Zeng, Rui, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023)
par: Liu, Qin, et autres
Publié: (2023)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025)
par: Xue, Eric, et autres
Publié: (2025)
Leaner Training, Lower Leakage: Revisiting Memorization in LLM Fine-Tuning with LoRA
par: Wang, Fei, et autres
Publié: (2025)
par: Wang, Fei, et autres
Publié: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMs
par: Lin, Sam, et autres
Publié: (2024)
par: Lin, Sam, et autres
Publié: (2024)
DIAGNOSIS: Detecting Unauthorized Data Usages in Text-to-image Diffusion Models
par: Wang, Zhenting, et autres
Publié: (2023)
par: Wang, Zhenting, et autres
Publié: (2023)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
par: Yan, Jun, et autres
Publié: (2023)
par: Yan, Jun, et autres
Publié: (2023)
Localizing Paragraph Memorization in Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)
par: Xiong, Alexander, et autres
Publié: (2025)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Randomized Masked Finetuning: An Efficient Way to Mitigate Memorization of PIIs in LLMs
par: Joshi, Kunj, et autres
Publié: (2025)
par: Joshi, Kunj, et autres
Publié: (2025)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
par: Qi, Zhenting, et autres
Publié: (2024)
par: Qi, Zhenting, et autres
Publié: (2024)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
par: Sivapiromrat, Sanhanat, et autres
Publié: (2025)
par: Sivapiromrat, Sanhanat, et autres
Publié: (2025)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods
par: Dey, Roopkatha, et autres
Publié: (2024)
par: Dey, Roopkatha, et autres
Publié: (2024)
On the Privacy Effect of Data Enhancement via the Lens of Memorization
par: Li, Xiao, et autres
Publié: (2022)
par: Li, Xiao, et autres
Publié: (2022)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
par: Sun, Bowen, et autres
Publié: (2026)
par: Sun, Bowen, et autres
Publié: (2026)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)
par: Chaudhari, Harsh, et autres
Publié: (2024)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
par: Price, Sara, et autres
Publié: (2024)
par: Price, Sara, et autres
Publié: (2024)
From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
Robustness Inspired Graph Backdoor Defense
par: Zhang, Zhiwei, et autres
Publié: (2024)
par: Zhang, Zhiwei, et autres
Publié: (2024)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
par: Kim, Taeyoun, et autres
Publié: (2024)
par: Kim, Taeyoun, et autres
Publié: (2024)
Position: Privacy Is Not Just Memorization!
par: Mireshghallah, Niloofar, et autres
Publié: (2025)
par: Mireshghallah, Niloofar, et autres
Publié: (2025)
WARDEN: Multi-Directional Backdoor Watermarks for Embedding-as-a-Service Copyright Protection
par: Shetty, Anudeex, et autres
Publié: (2024)
par: Shetty, Anudeex, et autres
Publié: (2024)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
par: Ahmed, Mohamed, et autres
Publié: (2025)
par: Ahmed, Mohamed, et autres
Publié: (2025)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
par: Wang, Zhepeng, et autres
Publié: (2024)
par: Wang, Zhepeng, et autres
Publié: (2024)
Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
par: Yao, Duanyi, et autres
Publié: (2026)
par: Yao, Duanyi, et autres
Publié: (2026)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)
par: Brown, Hannah, et autres
Publié: (2024)
Gradient Shaping: Enhancing Backdoor Attack Against Reverse Engineering
par: Zhu, Rui, et autres
Publié: (2023)
par: Zhu, Rui, et autres
Publié: (2023)
STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio
par: Park, Seong-Gyu, et autres
Publié: (2026)
par: Park, Seong-Gyu, et autres
Publié: (2026)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
par: He, Jiaming, et autres
Publié: (2024)
par: He, Jiaming, et autres
Publié: (2024)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
par: Kim, Heegyu, et autres
Publié: (2024)
par: Kim, Heegyu, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing
par: Liu, Zeyan, et autres
Publié: (2023)
par: Liu, Zeyan, et autres
Publié: (2023)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
par: Li, Nathaniel, et autres
Publié: (2024)
par: Li, Nathaniel, et autres
Publié: (2024)
Seal Your Backdoor with Variational Defense
par: Sabolić, Ivan, et autres
Publié: (2025)
par: Sabolić, Ivan, et autres
Publié: (2025)
Documents similaires
-
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
par: Zeng, Rui, et autres
Publié: (2024) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023) -
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023) -
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025) -
Leaner Training, Lower Leakage: Revisiting Memorization in LLM Fine-Tuning with LoRA
par: Wang, Fei, et autres
Publié: (2025)