Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Shuai, Jia, Meihuizi, Tuan, Luu Anh, Pan, Fengjun, Wen, Jinming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
di: Du, Wei, et al.
Pubblicazione: (2023)
di: Du, Wei, et al.
Pubblicazione: (2023)
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
di: Wen, Jinming, et al.
Pubblicazione: (2025)
di: Wen, Jinming, et al.
Pubblicazione: (2025)
Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Exploring Backdoor Vulnerabilities of Chat Models
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
di: Liu, Xuxu, et al.
Pubblicazione: (2025)
Selection-Based Vulnerabilities: Clean-Label Backdoor Attacks in Active Learning
di: Zhi, Yuhan, et al.
Pubblicazione: (2025)
di: Zhi, Yuhan, et al.
Pubblicazione: (2025)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
di: Li, Xi, et al.
Pubblicazione: (2024)
di: Li, Xi, et al.
Pubblicazione: (2024)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
Claim-Guided Textual Backdoor Attack for Practical Applications
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Exploiting Layer-Specific Vulnerabilities to Backdoor Attack in Federated Learning
di: Foroughi, Mohammad Hadi, et al.
Pubblicazione: (2026)
di: Foroughi, Mohammad Hadi, et al.
Pubblicazione: (2026)
Concept-Guided Backdoor Attack on Vision Language Models
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
Learnable Linguistic Watermarks for Tracing Model Extraction Attacks on Large Language Models
di: Bai, Minhao, et al.
Pubblicazione: (2024)
di: Bai, Minhao, et al.
Pubblicazione: (2024)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Does Few-shot Learning Suffer from Backdoor Attacks?
di: Liu, Xinwei, et al.
Pubblicazione: (2023)
di: Liu, Xinwei, et al.
Pubblicazione: (2023)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)