MBTSAD: Mitigating Backdoors in Language Models Based on Token Splitting and Attention Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Yidong, Niu, Jiafei, Yi, Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Rethinking Backdoor Detection Evaluation for Language Models
di: Yan, Jun, et al.
Pubblicazione: (2024)
di: Yan, Jun, et al.
Pubblicazione: (2024)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models
di: Fortier, Alexandrine, et al.
Pubblicazione: (2025)
di: Fortier, Alexandrine, et al.
Pubblicazione: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
Token-Level Privacy in Large Language Models
di: Harel, Re'em, et al.
Pubblicazione: (2025)
di: Harel, Re'em, et al.
Pubblicazione: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models
di: Gu, Haoran, et al.
Pubblicazione: (2025)
di: Gu, Haoran, et al.
Pubblicazione: (2025)
Task-Agnostic Detector for Insertion-Based Backdoor Attacks
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024)
di: Yi, Biao, et al.
Pubblicazione: (2024)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
di: Wen, Rui, et al.
Pubblicazione: (2026)
di: Wen, Rui, et al.
Pubblicazione: (2026)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
di: Yin, Rui, et al.
Pubblicazione: (2026)
di: Yin, Rui, et al.
Pubblicazione: (2026)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
di: Du, Wei, et al.
Pubblicazione: (2023)
di: Du, Wei, et al.
Pubblicazione: (2023)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
"Yes, My LoRD." Guiding Language Model Extraction with Locality Reinforced Distillation
di: Liang, Zi, et al.
Pubblicazione: (2024)
di: Liang, Zi, et al.
Pubblicazione: (2024)
Self and Cross-Model Distillation for LLMs: Effective Methods for Refusal Pattern Alignment
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
DiDOTS: Knowledge Distillation from Large-Language-Models for Dementia Obfuscation in Transcribed Speech
di: Woszczyk, Dominika, et al.
Pubblicazione: (2024)
di: Woszczyk, Dominika, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
di: Zhao, Gejian, et al.
Pubblicazione: (2025)
di: Zhao, Gejian, et al.
Pubblicazione: (2025)
Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
Data Extraction Attacks in Retrieval-Augmented Generation via Backdoors
di: Peng, Yuefeng, et al.
Pubblicazione: (2024)
di: Peng, Yuefeng, et al.
Pubblicazione: (2024)
Exploring Backdoor Vulnerabilities of Chat Models
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024) -
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025) -
Rethinking Backdoor Detection Evaluation for Language Models
di: Yan, Jun, et al.
Pubblicazione: (2024) -
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)