Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Peihai, Lyu, Xixiang, Li, Yige, Ma, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
por: Hu, Man, et al.
Publicado: (2025)
por: Hu, Man, et al.
Publicado: (2025)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
por: Du, Wei, et al.
Publicado: (2023)
por: Du, Wei, et al.
Publicado: (2023)
Exploring Backdoor Vulnerabilities of Chat Models
por: Hao, Yunzhuo, et al.
Publicado: (2024)
por: Hao, Yunzhuo, et al.
Publicado: (2024)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
por: Li, Yige, et al.
Publicado: (2025)
por: Li, Yige, et al.
Publicado: (2025)
Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs
por: Li, Yige, et al.
Publicado: (2026)
por: Li, Yige, et al.
Publicado: (2026)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
por: Cao, Yuanpu, et al.
Publicado: (2023)
por: Cao, Yuanpu, et al.
Publicado: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
por: Wu, Zongru, et al.
Publicado: (2024)
por: Wu, Zongru, et al.
Publicado: (2024)
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
por: Wu, Zongru, et al.
Publicado: (2024)
por: Wu, Zongru, et al.
Publicado: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
por: Lee, Hong kyu, et al.
Publicado: (2025)
por: Lee, Hong kyu, et al.
Publicado: (2025)
Concept-Guided Backdoor Attack on Vision Language Models
por: Shen, Haoyu, et al.
Publicado: (2025)
por: Shen, Haoyu, et al.
Publicado: (2025)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
por: Ji, Wence, et al.
Publicado: (2025)
por: Ji, Wence, et al.
Publicado: (2025)
LoRATK: LoRA Once, Backdoor Everywhere in the Share-and-Play Ecosystem
por: Liu, Hongyi, et al.
Publicado: (2024)
por: Liu, Hongyi, et al.
Publicado: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
por: Tong, Terry, et al.
Publicado: (2025)
por: Tong, Terry, et al.
Publicado: (2025)
Claim-Guided Textual Backdoor Attack for Practical Applications
por: Song, Minkyoo, et al.
Publicado: (2024)
por: Song, Minkyoo, et al.
Publicado: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
por: Raghuram, Jayaram, et al.
Publicado: (2024)
por: Raghuram, Jayaram, et al.
Publicado: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
por: Zhao, Wei, et al.
Publicado: (2024)
por: Zhao, Wei, et al.
Publicado: (2024)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
por: Wei, Jiali, et al.
Publicado: (2026)
por: Wei, Jiali, et al.
Publicado: (2026)
Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models
por: Yu, Miao, et al.
Publicado: (2025)
por: Yu, Miao, et al.
Publicado: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
por: Tong, Terry, et al.
Publicado: (2024)
por: Tong, Terry, et al.
Publicado: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
por: Yang, Wenkai, et al.
Publicado: (2024)
por: Yang, Wenkai, et al.
Publicado: (2024)
Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models
por: Braun, Tobias, et al.
Publicado: (2026)
por: Braun, Tobias, et al.
Publicado: (2026)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
por: Shin, Jeongjin, et al.
Publicado: (2024)
por: Shin, Jeongjin, et al.
Publicado: (2024)
Internal Safety Collapse in Frontier Large Language Models
por: Wu, Yutao, et al.
Publicado: (2026)
por: Wu, Yutao, et al.
Publicado: (2026)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
por: Zhao, Shuai, et al.
Publicado: (2025)
por: Zhao, Shuai, et al.
Publicado: (2025)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
por: Cheng, Pengzhou, et al.
Publicado: (2024)
por: Cheng, Pengzhou, et al.
Publicado: (2024)
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
por: Jin, Haotian, et al.
Publicado: (2025)
por: Jin, Haotian, et al.
Publicado: (2025)
Buffer is All You Need: Defending Federated Learning against Backdoor Attacks under Non-iids via Buffering
por: Lyu, Xingyu, et al.
Publicado: (2025)
por: Lyu, Xingyu, et al.
Publicado: (2025)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
por: Guo, Weiyang, et al.
Publicado: (2026)
por: Guo, Weiyang, et al.
Publicado: (2026)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
Backdoor Defense in Diffusion Models via Spatial Attention Unlearning
por: Jha, Abha, et al.
Publicado: (2025)
por: Jha, Abha, et al.
Publicado: (2025)
Backdoor Attack with Invisible Triggers Based on Model Architecture Modification
por: Ma, Yuan, et al.
Publicado: (2024)
por: Ma, Yuan, et al.
Publicado: (2024)
Ejemplares similares
-
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
por: Hu, Man, et al.
Publicado: (2025) -
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
por: Zhao, Shuai, et al.
Publicado: (2024) -
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
por: Zhao, Shuai, et al.
Publicado: (2024) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023) -
UOR: Universal Backdoor Attacks on Pre-trained Language Models
por: Du, Wei, et al.
Publicado: (2023)