Securing Large Language Models (LLMs) from Prompt Injection Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Suri, Omar Farooq Khan, McCrae, John |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
di: Hines, Keegan, et al.
Pubblicazione: (2024)
di: Hines, Keegan, et al.
Pubblicazione: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
di: Shao, Zedian, et al.
Pubblicazione: (2024)
di: Shao, Zedian, et al.
Pubblicazione: (2024)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection
di: Kimura, Subaru, et al.
Pubblicazione: (2024)
di: Kimura, Subaru, et al.
Pubblicazione: (2024)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
di: Liu, Yupei, et al.
Pubblicazione: (2023)
di: Liu, Yupei, et al.
Pubblicazione: (2023)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
di: Chaudhari, Harsh, et al.
Pubblicazione: (2024)
di: Chaudhari, Harsh, et al.
Pubblicazione: (2024)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
SPML: A DSL for Defending Language Models Against Prompt Attacks
di: Sharma, Reshabh K, et al.
Pubblicazione: (2024)
di: Sharma, Reshabh K, et al.
Pubblicazione: (2024)
TFL: Targeted Bit-Flip Attack on Large Language Model
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening
di: Zhang, Mohan, et al.
Pubblicazione: (2026)
di: Zhang, Mohan, et al.
Pubblicazione: (2026)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
Prompt Public Large Language Models to Synthesize Data for Private On-device Applications
di: Wu, Shanshan, et al.
Pubblicazione: (2024)
di: Wu, Shanshan, et al.
Pubblicazione: (2024)
Prompt Injection Attacks on Large Language Models in Oncology
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
di: You, Weiqiu, et al.
Pubblicazione: (2024)
di: You, Weiqiu, et al.
Pubblicazione: (2024)
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
di: Zhang, Ruisi, et al.
Pubblicazione: (2025)
di: Zhang, Ruisi, et al.
Pubblicazione: (2025)
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
di: Clop, Cody, et al.
Pubblicazione: (2024)
di: Clop, Cody, et al.
Pubblicazione: (2024)
SecureNet: A Comparative Study of DeBERTa and Large Language Models for Phishing Detection
di: Mahendru, Sakshi, et al.
Pubblicazione: (2024)
di: Mahendru, Sakshi, et al.
Pubblicazione: (2024)
Auditing Prompt Caching in Language Model APIs
di: Gu, Chenchen, et al.
Pubblicazione: (2025)
di: Gu, Chenchen, et al.
Pubblicazione: (2025)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
di: He, Jiaming, et al.
Pubblicazione: (2024)
di: He, Jiaming, et al.
Pubblicazione: (2024)
Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
A Watermark for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
di: Yao, Duanyi, et al.
Pubblicazione: (2026)
di: Yao, Duanyi, et al.
Pubblicazione: (2026)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
di: Li, Qizhang, et al.
Pubblicazione: (2024)
di: Li, Qizhang, et al.
Pubblicazione: (2024)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
On the Reliability of Watermarks for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Graphene: Infrastructure Security Posture Analysis with AI-generated Attack Graphs
di: Jin, Xin, et al.
Pubblicazione: (2023)
di: Jin, Xin, et al.
Pubblicazione: (2023)
PIArena: A Platform for Prompt Injection Evaluation
di: Geng, Runpeng, et al.
Pubblicazione: (2026)
di: Geng, Runpeng, et al.
Pubblicazione: (2026)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
Documenti analoghi
-
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024) -
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023) -
Defending Against Indirect Prompt Injection Attacks With Spotlighting
di: Hines, Keegan, et al.
Pubblicazione: (2024) -
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
di: Shao, Zedian, et al.
Pubblicazione: (2024) -
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)