UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Huawei, Lao, Yingjie, Geng, Tong, Yu, Tan, Zhao, Weijie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
di: Liu, Yupei, et al.
Pubblicazione: (2023)
di: Liu, Yupei, et al.
Pubblicazione: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Defense against Prompt Injection Attacks via Mixture of Encodings
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
di: Liu, Pang, et al.
Pubblicazione: (2026)
di: Liu, Pang, et al.
Pubblicazione: (2026)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
Fine-tuned Large Language Models (LLMs): Improved Prompt Injection Attacks Detection
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
RapidUn: Influence-Driven Parameter Reweighting for Efficient Large Language Model Unlearning
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2025)
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2025)
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
DMin: Scalable Training Data Influence Estimation for Diffusion Models
di: Lin, Huawei, et al.
Pubblicazione: (2024)
di: Lin, Huawei, et al.
Pubblicazione: (2024)
Securing Large Language Models (LLMs) from Prompt Injection Attacks
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
di: Yi, Jingwei, et al.
Pubblicazione: (2023)
di: Yi, Jingwei, et al.
Pubblicazione: (2023)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
di: Chen, Yulin, et al.
Pubblicazione: (2025)
di: Chen, Yulin, et al.
Pubblicazione: (2025)
Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks
di: Sun, Zhifan, et al.
Pubblicazione: (2024)
di: Sun, Zhifan, et al.
Pubblicazione: (2024)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context
di: Das, Nilanjana, et al.
Pubblicazione: (2024)
di: Das, Nilanjana, et al.
Pubblicazione: (2024)
UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor Attacks
di: Zhao, Bingyin, et al.
Pubblicazione: (2023)
di: Zhao, Bingyin, et al.
Pubblicazione: (2023)
HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2026)
di: Zhao, Guoshenghui, et al.
Pubblicazione: (2026)
Prompt Injection Attacks in Defended Systems
di: Khomsky, Daniil, et al.
Pubblicazione: (2024)
di: Khomsky, Daniil, et al.
Pubblicazione: (2024)
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
TF-Attack: Transferable and Fast Adversarial Attacks on Large Language Models
di: Li, Zelin, et al.
Pubblicazione: (2024)
di: Li, Zelin, et al.
Pubblicazione: (2024)
Defense Against Syntactic Textual Backdoor Attacks with Token Substitution
di: Li, Xinglin, et al.
Pubblicazione: (2024)
di: Li, Xinglin, et al.
Pubblicazione: (2024)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Adversarial Attacks on LLM-as-a-Judge Systems: Insights from Prompt Injections
di: Maloyan, Narek, et al.
Pubblicazione: (2025)
di: Maloyan, Narek, et al.
Pubblicazione: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024)
di: Lu, Dong, et al.
Pubblicazione: (2024)
DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation
di: Chu, Rui, et al.
Pubblicazione: (2026)
di: Chu, Rui, et al.
Pubblicazione: (2026)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
Robustness of Large Language Models Against Adversarial Attacks
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
Adversarial Attacks and Defense for Conversation Entailment Task
di: Yang, Zhenning, et al.
Pubblicazione: (2024)
di: Yang, Zhenning, et al.
Pubblicazione: (2024)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
di: Mu, Lin, et al.
Pubblicazione: (2025)
di: Mu, Lin, et al.
Pubblicazione: (2025)
Token-wise Influential Training Data Retrieval for Large Language Models
di: Lin, Huawei, et al.
Pubblicazione: (2024)
di: Lin, Huawei, et al.
Pubblicazione: (2024)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
di: Liu, Yupei, et al.
Pubblicazione: (2023) -
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023) -
Defense against Prompt Injection Attacks via Mixture of Encodings
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025) -
VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
di: Liu, Pang, et al.
Pubblicazione: (2026)