PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Chenlong, Geng, Runpeng, Wang, Yanting, Jia, Jinyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PIArena: A Platform for Prompt Injection Evaluation
par: Geng, Runpeng, et autres
Publié: (2026)
par: Geng, Runpeng, et autres
Publié: (2026)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
par: Geng, Runpeng, et autres
Publié: (2025)
par: Geng, Runpeng, et autres
Publié: (2025)
FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption
par: Wang, Yanting, et autres
Publié: (2026)
par: Wang, Yanting, et autres
Publié: (2026)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023)
par: Liu, Yupei, et autres
Publié: (2023)
AgentWatcher: A Rule-based Prompt Injection Monitor
par: Wang, Yanting, et autres
Publié: (2026)
par: Wang, Yanting, et autres
Publié: (2026)
AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption
par: Wang, Yanting, et autres
Publié: (2025)
par: Wang, Yanting, et autres
Publié: (2025)
TracLLM: A Generic Framework for Attributing Long Context LLMs
par: Wang, Yanting, et autres
Publié: (2025)
par: Wang, Yanting, et autres
Publié: (2025)
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
par: Zou, Wei, et autres
Publié: (2024)
par: Zou, Wei, et autres
Publié: (2024)
PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features
par: Zou, Wei, et autres
Publié: (2025)
par: Zou, Wei, et autres
Publié: (2025)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
par: Wang, Yanting, et autres
Publié: (2025)
par: Wang, Yanting, et autres
Publié: (2025)
UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
par: Geng, Runpeng, et autres
Publié: (2025)
par: Geng, Runpeng, et autres
Publié: (2025)
A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks
par: Hossain, S M Asif, et autres
Publié: (2025)
par: Hossain, S M Asif, et autres
Publié: (2025)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
par: Gohil, Vasudev, et autres
Publié: (2024)
par: Gohil, Vasudev, et autres
Publié: (2024)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
par: Liu, Mingrui, et autres
Publié: (2026)
par: Liu, Mingrui, et autres
Publié: (2026)
Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents
par: Zhan, Qiusi, et autres
Publié: (2025)
par: Zhan, Qiusi, et autres
Publié: (2025)
AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
par: Debenedetti, Edoardo, et autres
Publié: (2024)
par: Debenedetti, Edoardo, et autres
Publié: (2024)
Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense
par: Zhang, Shuhao, et autres
Publié: (2026)
par: Zhang, Shuhao, et autres
Publié: (2026)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
par: Nasr, Milad, et autres
Publié: (2025)
par: Nasr, Milad, et autres
Publié: (2025)
SecInfer: Preventing Prompt Injection via Inference-time Scaling
par: Liu, Yupei, et autres
Publié: (2025)
par: Liu, Yupei, et autres
Publié: (2025)
Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
par: Morasso, Cristian, et autres
Publié: (2026)
par: Morasso, Cristian, et autres
Publié: (2026)
Leveraging Reinforcement Learning in Red Teaming for Advanced Ransomware Attack Simulations
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
Automated Cyber Defense with Generalizable Graph-based Reinforcement Learning Agents
par: King, Isaiah J., et autres
Publié: (2025)
par: King, Isaiah J., et autres
Publié: (2025)
Early Approaches to Adversarial Fine-Tuning for Prompt Injection Defense: A 2022 Study of GPT-3 and Contemporary Models
par: Sandoval, Gustavo, et autres
Publié: (2025)
par: Sandoval, Gustavo, et autres
Publié: (2025)
A Critical Evaluation of Defenses against Prompt Injection Attacks
par: Jia, Yuqi, et autres
Publié: (2025)
par: Jia, Yuqi, et autres
Publié: (2025)
EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method
par: Wang, Yanting, et autres
Publié: (2026)
par: Wang, Yanting, et autres
Publié: (2026)
LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
par: Panebianco, Francesco, et autres
Publié: (2025)
par: Panebianco, Francesco, et autres
Publié: (2025)
Neural Exec: Learning (and Learning from) Execution Triggers for Prompt Injection Attacks
par: Pasquini, Dario, et autres
Publié: (2024)
par: Pasquini, Dario, et autres
Publié: (2024)
Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs
par: Maiorano, Alexandre Cristovão
Publié: (2026)
par: Maiorano, Alexandre Cristovão
Publié: (2026)
Preventing Prompt Injection with Type-Directed Privilege Separation
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents
par: He, Pengfei, et autres
Publié: (2026)
par: He, Pengfei, et autres
Publié: (2026)
Red Teaming with Artificial Intelligence-Driven Cyberattacks: A Scoping Review
par: Al-Azzawi, Mays, et autres
Publié: (2025)
par: Al-Azzawi, Mays, et autres
Publié: (2025)
SecAlign: Defending Against Prompt Injection with Preference Optimization
par: Chen, Sizhe, et autres
Publié: (2024)
par: Chen, Sizhe, et autres
Publié: (2024)
Design Patterns for Securing LLM Agents against Prompt Injections
par: Beurer-Kellner, Luca, et autres
Publié: (2025)
par: Beurer-Kellner, Luca, et autres
Publié: (2025)
Lessons from Defending Gemini Against Indirect Prompt Injections
par: Shi, Chongyang, et autres
Publié: (2025)
par: Shi, Chongyang, et autres
Publié: (2025)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
par: Yang, Xiaoxue, et autres
Publié: (2025)
par: Yang, Xiaoxue, et autres
Publié: (2025)
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
par: Sinha, Anusha, et autres
Publié: (2025)
par: Sinha, Anusha, et autres
Publié: (2025)
Evaluating Differential Privacy Against Membership Inference in Federated Learning: Insights from the NIST Genomics Red Team Challenge
par: Bertoli, Gustavo de Carvalho
Publié: (2026)
par: Bertoli, Gustavo de Carvalho
Publié: (2026)
Noise as a Double-Edged Sword: Reinforcement Learning Exploits Randomized Defenses in Neural Networks
par: Bakos, Steve, et autres
Publié: (2024)
par: Bakos, Steve, et autres
Publié: (2024)
Documents similaires
-
PIArena: A Platform for Prompt Injection Evaluation
par: Geng, Runpeng, et autres
Publié: (2026) -
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
par: Geng, Runpeng, et autres
Publié: (2025) -
FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption
par: Wang, Yanting, et autres
Publié: (2026) -
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023) -
AgentWatcher: A Rule-based Prompt Injection Monitor
par: Wang, Yanting, et autres
Publié: (2026)