Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shuhao, Li, Jiarui, Cao, Qi, Zhang, Ruiyi, Xie, Pengtao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025)
par: Xue, Eric, et autres
Publié: (2025)
Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents
par: Zhan, Qiusi, et autres
Publié: (2025)
par: Zhan, Qiusi, et autres
Publié: (2025)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
par: Nasr, Milad, et autres
Publié: (2025)
par: Nasr, Milad, et autres
Publié: (2025)
Models Under SCOPE: Scalable and Controllable Routing via Pre-hoc Reasoning
par: Cao, Qi, et autres
Publié: (2026)
par: Cao, Qi, et autres
Publié: (2026)
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
par: Yin, Chenlong, et autres
Publié: (2026)
par: Yin, Chenlong, et autres
Publié: (2026)
AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
par: Debenedetti, Edoardo, et autres
Publié: (2024)
par: Debenedetti, Edoardo, et autres
Publié: (2024)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
par: Liu, Mingrui, et autres
Publié: (2026)
par: Liu, Mingrui, et autres
Publié: (2026)
A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks
par: Hossain, S M Asif, et autres
Publié: (2025)
par: Hossain, S M Asif, et autres
Publié: (2025)
Early Approaches to Adversarial Fine-Tuning for Prompt Injection Defense: A 2022 Study of GPT-3 and Contemporary Models
par: Sandoval, Gustavo, et autres
Publié: (2025)
par: Sandoval, Gustavo, et autres
Publié: (2025)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023)
par: Liu, Yupei, et autres
Publié: (2023)
LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
par: Panebianco, Francesco, et autres
Publié: (2025)
par: Panebianco, Francesco, et autres
Publié: (2025)
Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs
par: Maiorano, Alexandre Cristovão
Publié: (2026)
par: Maiorano, Alexandre Cristovão
Publié: (2026)
FilterFL: Knowledge Filtering-based Data-Free Backdoor Defense for Federated Learning
par: Yang, Yanxin, et autres
Publié: (2023)
par: Yang, Yanxin, et autres
Publié: (2023)
Preventing Prompt Injection with Type-Directed Privilege Separation
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
IDEA: Invariant Defense for Graph Adversarial Robustness
par: Tao, Shuchang, et autres
Publié: (2023)
par: Tao, Shuchang, et autres
Publié: (2023)
Learning to Look Benign: Targeted Evasion of Malware Detectors via API Import Injection
par: Dautartas, Juozas, et autres
Publié: (2026)
par: Dautartas, Juozas, et autres
Publié: (2026)
SecAlign: Defending Against Prompt Injection with Preference Optimization
par: Chen, Sizhe, et autres
Publié: (2024)
par: Chen, Sizhe, et autres
Publié: (2024)
Design Patterns for Securing LLM Agents against Prompt Injections
par: Beurer-Kellner, Luca, et autres
Publié: (2025)
par: Beurer-Kellner, Luca, et autres
Publié: (2025)
Lessons from Defending Gemini Against Indirect Prompt Injections
par: Shi, Chongyang, et autres
Publié: (2025)
par: Shi, Chongyang, et autres
Publié: (2025)
EvoMail: Self-Evolving Cognitive Agents for Adaptive Spam and Phishing Email Defense
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks
par: Fu, Yanzhang, et autres
Publié: (2026)
par: Fu, Yanzhang, et autres
Publié: (2026)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
par: Yang, Xiaoxue, et autres
Publié: (2025)
par: Yang, Xiaoxue, et autres
Publié: (2025)
PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features
par: Zou, Wei, et autres
Publié: (2025)
par: Zou, Wei, et autres
Publié: (2025)
Certified Defense on the Fairness of Graph Neural Networks
par: Dong, Yushun, et autres
Publié: (2023)
par: Dong, Yushun, et autres
Publié: (2023)
Neural Exec: Learning (and Learning from) Execution Triggers for Prompt Injection Attacks
par: Pasquini, Dario, et autres
Publié: (2024)
par: Pasquini, Dario, et autres
Publié: (2024)
Adaptive Deception Framework with Behavioral Analysis for Enhanced Cybersecurity Defense
par: AL-Zahrani, Basil Abdullah
Publié: (2025)
par: AL-Zahrani, Basil Abdullah
Publié: (2025)
GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks
par: Li, Rongchang, et autres
Publié: (2024)
par: Li, Rongchang, et autres
Publié: (2024)
BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
par: Sahabandu, Dinuka, et autres
Publié: (2024)
par: Sahabandu, Dinuka, et autres
Publié: (2024)
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
par: Clop, Cody, et autres
Publié: (2024)
par: Clop, Cody, et autres
Publié: (2024)
How Not to Detect Prompt Injections with an LLM
par: Choudhary, Sarthak, et autres
Publié: (2025)
par: Choudhary, Sarthak, et autres
Publié: (2025)
Combining Machine Learning Defenses without Conflicts
par: Duddu, Vasisht, et autres
Publié: (2024)
par: Duddu, Vasisht, et autres
Publié: (2024)
Evaluations of Machine Learning Privacy Defenses are Misleading
par: Aerni, Michael, et autres
Publié: (2024)
par: Aerni, Michael, et autres
Publié: (2024)
BeniFul: Backdoor Defense via Middle Feature Analysis for Deep Neural Networks
par: Li, Xinfu, et autres
Publié: (2024)
par: Li, Xinfu, et autres
Publié: (2024)
ARBoids: Adaptive Residual Reinforcement Learning With Boids Model for Cooperative Multi-USV Target Defense
par: Tao, Jiyue, et autres
Publié: (2025)
par: Tao, Jiyue, et autres
Publié: (2025)
Data Reconstruction Attacks and Defenses: A Systematic Evaluation
par: Liu, Sheng, et autres
Publié: (2024)
par: Liu, Sheng, et autres
Publié: (2024)
Robustness Inspired Graph Backdoor Defense
par: Zhang, Zhiwei, et autres
Publié: (2024)
par: Zhang, Zhiwei, et autres
Publié: (2024)
RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
Documents similaires
-
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025) -
Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents
par: Zhan, Qiusi, et autres
Publié: (2025) -
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
par: Nasr, Milad, et autres
Publié: (2025) -
Models Under SCOPE: Scalable and Controllable Routing via Pre-hoc Reasoning
par: Cao, Qi, et autres
Publié: (2026) -
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
par: Yin, Chenlong, et autres
Publié: (2026)