Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Labunets, Andrey, Pandya, Nishit V., Hooda, Ashish, Fu, Xiaohan, Fernandes, Earlence |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks
par: Pandya, Nishit V., et autres
Publié: (2025)
par: Pandya, Nishit V., et autres
Publié: (2025)
Systems Security Foundations for Agentic Computing
par: Christodorescu, Mihai, et autres
Publié: (2025)
par: Christodorescu, Mihai, et autres
Publié: (2025)
Agent Security is a Systems Problem
par: Christodorescu, Mihai, et autres
Publié: (2026)
par: Christodorescu, Mihai, et autres
Publié: (2026)
The Vulnerability of LLM Rankers to Prompt Injection Attacks
par: Yin, Yu, et autres
Publié: (2026)
par: Yin, Yu, et autres
Publié: (2026)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
par: Li, Zongjie, et autres
Publié: (2025)
par: Li, Zongjie, et autres
Publié: (2025)
ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets
par: Frikha, Ahmed, et autres
Publié: (2024)
par: Frikha, Ahmed, et autres
Publié: (2024)
Imprompter: Tricking LLM Agents into Improper Tool Use
par: Fu, Xiaohan, et autres
Publié: (2024)
par: Fu, Xiaohan, et autres
Publié: (2024)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
par: Jaiswal, Piyush, et autres
Publié: (2026)
par: Jaiswal, Piyush, et autres
Publié: (2026)
PromptShield: Deployable Detection for Prompt Injection Attacks
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks
par: Wang, Zi, et autres
Publié: (2024)
par: Wang, Zi, et autres
Publié: (2024)
Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
par: Zhong, Yinan, et autres
Publié: (2025)
par: Zhong, Yinan, et autres
Publié: (2025)
Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems
par: Maloyan, Narek, et autres
Publié: (2026)
par: Maloyan, Narek, et autres
Publié: (2026)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
par: Yeo, Andrew, et autres
Publié: (2025)
par: Yeo, Andrew, et autres
Publié: (2025)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI
par: Jin, Heng, et autres
Publié: (2026)
par: Jin, Heng, et autres
Publié: (2026)
VortexPIA: Indirect Prompt Injection Attack against LLMs for Efficient Extraction of User Privacy
par: Cui, Yu, et autres
Publié: (2025)
par: Cui, Yu, et autres
Publié: (2025)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
par: Yang, Xiaoxue, et autres
Publié: (2025)
par: Yang, Xiaoxue, et autres
Publié: (2025)
Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs
par: Wang, Jiawen, et autres
Publié: (2025)
par: Wang, Jiawen, et autres
Publié: (2025)
TopicAttack: An Indirect Prompt Injection Attack via Topic Transition
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
SoK: Reducing the Vulnerability of Fine-tuned Language Models to Membership Inference Attacks
par: Amit, Guy, et autres
Publié: (2024)
par: Amit, Guy, et autres
Publié: (2024)
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025)
par: Shi, Jiawen, et autres
Publié: (2025)
PINA: Prompt Injection Attack against Navigation Agents
par: Liu, Jiani, et autres
Publié: (2026)
par: Liu, Jiani, et autres
Publié: (2026)
Can Indirect Prompt Injection Attacks Be Detected and Removed?
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
Privacy in ERP Systems: Behavioral Models of Developers and Consultants
par: Pang, Alicia, et autres
Publié: (2026)
par: Pang, Alicia, et autres
Publié: (2026)
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
par: Shi, Jiawen, et autres
Publié: (2024)
par: Shi, Jiawen, et autres
Publié: (2024)
Prompt Engineering vs. Fine-Tuning for LLM-Based Vulnerability Detection in Solana and Algorand Smart Contracts
par: Boi, Biagio, et autres
Publié: (2025)
par: Boi, Biagio, et autres
Publié: (2025)
PromptLocate: Localizing Prompt Injection Attacks
par: Jia, Yuqi, et autres
Publié: (2025)
par: Jia, Yuqi, et autres
Publié: (2025)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
par: Hung, Kuo-Han, et autres
Publié: (2024)
par: Hung, Kuo-Han, et autres
Publié: (2024)
ceLLMate: Sandboxing Browser AI Agents
par: Meng, Luoxi, et autres
Publié: (2025)
par: Meng, Luoxi, et autres
Publié: (2025)
Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap
par: Huang, Feiyang, et autres
Publié: (2026)
par: Huang, Feiyang, et autres
Publié: (2026)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks
par: Jia, Yuqi, et autres
Publié: (2026)
par: Jia, Yuqi, et autres
Publié: (2026)
ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data
par: Wang, Reachal, et autres
Publié: (2025)
par: Wang, Reachal, et autres
Publié: (2025)
Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs
par: Pathade, Chetan
Publié: (2025)
par: Pathade, Chetan
Publié: (2025)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
par: Wang, Zihan, et autres
Publié: (2026)
par: Wang, Zihan, et autres
Publié: (2026)
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
par: Cui, Jing, et autres
Publié: (2025)
par: Cui, Jing, et autres
Publié: (2025)
From Prompt Injections to SQL Injection Attacks: How Protected is Your LLM-Integrated Web Application?
par: Pedro, Rodrigo, et autres
Publié: (2023)
par: Pedro, Rodrigo, et autres
Publié: (2023)
Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization
par: Verma, Ishaan, et autres
Publié: (2025)
par: Verma, Ishaan, et autres
Publié: (2025)
ShadowCode: Towards (Automatic) External Prompt Injection Attack against Code LLMs
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
Documents similaires
-
May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks
par: Pandya, Nishit V., et autres
Publié: (2025) -
Systems Security Foundations for Agentic Computing
par: Christodorescu, Mihai, et autres
Publié: (2025) -
Agent Security is a Systems Problem
par: Christodorescu, Mihai, et autres
Publié: (2026) -
The Vulnerability of LLM Rankers to Prompt Injection Attacks
par: Yin, Yu, et autres
Publié: (2026) -
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
par: Li, Zongjie, et autres
Publié: (2025)