A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yihe, Ni, Tao, Lee, Wei-Bin, Zhao, Qingchuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024)
di: Cui, Jing, et al.
Pubblicazione: (2024)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
di: Li, Xi, et al.
Pubblicazione: (2024)
di: Li, Xi, et al.
Pubblicazione: (2024)
SoK: The Last Line of Defense: On Backdoor Defense Evaluation
di: Abad, Gorka, et al.
Pubblicazione: (2025)
di: Abad, Gorka, et al.
Pubblicazione: (2025)
BackdoorMBTI: A Backdoor Learning Multimodal Benchmark Tool Kit for Backdoor Defense Evaluation
di: Yu, Haiyang, et al.
Pubblicazione: (2024)
di: Yu, Haiyang, et al.
Pubblicazione: (2024)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
di: Mo, Xiaoxing, et al.
Pubblicazione: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
BELT: Old-School Backdoor Attacks can Evade the State-of-the-Art Defense with Backdoor Exclusivity Lifting
di: Qiu, Huming, et al.
Pubblicazione: (2023)
di: Qiu, Huming, et al.
Pubblicazione: (2023)
A Survey of Attacks on Large Language Models
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
MARS: A Malignity-Aware Backdoor Defense in Federated Learning
di: Wan, Wei, et al.
Pubblicazione: (2025)
di: Wan, Wei, et al.
Pubblicazione: (2025)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
di: Fu, Haowei, et al.
Pubblicazione: (2025)
di: Fu, Haowei, et al.
Pubblicazione: (2025)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
di: Li, Yige, et al.
Pubblicazione: (2025)
di: Li, Yige, et al.
Pubblicazione: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
Evaluation of Prompt Injection Defenses in Large Language Models
di: Deep, Priyal, et al.
Pubblicazione: (2026)
di: Deep, Priyal, et al.
Pubblicazione: (2026)
Concept-Guided Backdoor Attack on Vision Language Models
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
di: Li, Wenjuan, et al.
Pubblicazione: (2026)
di: Li, Wenjuan, et al.
Pubblicazione: (2026)
AI-Driven Cybersecurity Threats: A Survey of Emerging Risks and Defensive Strategies
di: Erukude, Sai Teja, et al.
Pubblicazione: (2026)
di: Erukude, Sai Teja, et al.
Pubblicazione: (2026)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs
di: Li, Yige, et al.
Pubblicazione: (2026)
di: Li, Yige, et al.
Pubblicazione: (2026)
Evolutionary Trigger Detection and Lightweight Model Repair Based Backdoor Defense
di: Zhou, Qi, et al.
Pubblicazione: (2024)
di: Zhou, Qi, et al.
Pubblicazione: (2024)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
di: Du, Wei, et al.
Pubblicazione: (2023)
di: Du, Wei, et al.
Pubblicazione: (2023)
Defenses Against Prompt Attacks Learn Surface Heuristics
di: Li, Shawn, et al.
Pubblicazione: (2026)
di: Li, Shawn, et al.
Pubblicazione: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Backdooring Bias in Large Language Models
di: Das, Anudeep, et al.
Pubblicazione: (2026)
di: Das, Anudeep, et al.
Pubblicazione: (2026)
Exploiting the Vulnerability of Large Language Models via Defense-Aware Architectural Backdoor
di: Miah, Abdullah Arafat, et al.
Pubblicazione: (2024)
di: Miah, Abdullah Arafat, et al.
Pubblicazione: (2024)
A Survey of Model Extraction Attacks and Defenses in Distributed Computing Environments
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Robust Knowledge Distillation in Federated Learning: Counteracting Backdoor Attacks
di: Alharbi, Ebtisaam, et al.
Pubblicazione: (2025)
di: Alharbi, Ebtisaam, et al.
Pubblicazione: (2025)
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
di: Cui, Jing, et al.
Pubblicazione: (2025)
di: Cui, Jing, et al.
Pubblicazione: (2025)
The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey
di: Kim, Juhee, et al.
Pubblicazione: (2026)
di: Kim, Juhee, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024) -
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025) -
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026) -
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024)