Prompt Inject Detection with Generative Explanation as an Investigative Tool
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Jonathan, Wong, Swee Liang, Yuan, Yidi, Chia, Xin Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Reasoning Capacity of SLM using Cognitive Enhancement
par: Pan, Jonathan, et autres
Publié: (2024)
par: Pan, Jonathan, et autres
Publié: (2024)
Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States
par: Chia, Xin Wei, et autres
Publié: (2025)
par: Chia, Xin Wei, et autres
Publié: (2025)
Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs
par: Pallakonda, Bhanu, et autres
Publié: (2026)
par: Pallakonda, Bhanu, et autres
Publié: (2026)
LLMail-Inject: A Dataset from a Realistic Adaptive Prompt Injection Challenge
par: Abdelnabi, Sahar, et autres
Publié: (2025)
par: Abdelnabi, Sahar, et autres
Publié: (2025)
AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs
par: Wang, Che, et autres
Publié: (2026)
par: Wang, Che, et autres
Publié: (2026)
AiRacleX: Automated Detection of Price Oracle Manipulations via LLM-Driven Knowledge Mining and Prompt Generation
par: Gao, Bo, et autres
Publié: (2025)
par: Gao, Bo, et autres
Publié: (2025)
Injecting Bias into Text Classification Models using Backdoor Attacks
par: Yavuz, A. Dilara, et autres
Publié: (2024)
par: Yavuz, A. Dilara, et autres
Publié: (2024)
Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents
par: Zou, Wei, et autres
Publié: (2026)
par: Zou, Wei, et autres
Publié: (2026)
ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection
par: Zhao, Wei, et autres
Publié: (2026)
par: Zhao, Wei, et autres
Publié: (2026)
Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance
par: Liu, Fazhong, et autres
Publié: (2026)
par: Liu, Fazhong, et autres
Publié: (2026)
An LLM-Assisted Easy-to-Trigger Backdoor Attack on Code Completion Models: Injecting Disguised Vulnerabilities against Strong Detection
par: Yan, Shenao, et autres
Publié: (2024)
par: Yan, Shenao, et autres
Publié: (2024)
Routing-Aware Explanations for Mixture of Experts Graph Models in Malware Detection
par: Shokouhinejad, Hossein, et autres
Publié: (2026)
par: Shokouhinejad, Hossein, et autres
Publié: (2026)
AdInject: Real-World Black-Box Attacks on Web Agents via Advertising Delivery
par: Wang, Haowei, et autres
Publié: (2025)
par: Wang, Haowei, et autres
Publié: (2025)
IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection
par: Chia-Pei, et autres
Publié: (2026)
par: Chia-Pei, et autres
Publié: (2026)
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
par: Shi, Jiawen, et autres
Publié: (2024)
par: Shi, Jiawen, et autres
Publié: (2024)
VADER: A Human-Evaluated Benchmark for Vulnerability Assessment, Detection, Explanation, and Remediation
par: Liu, Ethan TS., et autres
Publié: (2025)
par: Liu, Ethan TS., et autres
Publié: (2025)
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025)
par: Sneh, Jonathan, et autres
Publié: (2025)
Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control
par: Uppala, Rohith
Publié: (2026)
par: Uppala, Rohith
Publié: (2026)
VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
par: Liu, Pang, et autres
Publié: (2026)
par: Liu, Pang, et autres
Publié: (2026)
Prompt and Circumstances: Evaluating the Efficacy of Human Prompt Inference in AI-Generated Art
par: Trinh, Khoi, et autres
Publié: (2026)
par: Trinh, Khoi, et autres
Publié: (2026)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
par: Chen, Zhuowei, et autres
Publié: (2025)
par: Chen, Zhuowei, et autres
Publié: (2025)
Defending against Indirect Prompt Injection by Instruction Detection
par: Wen, Tongyu, et autres
Publié: (2025)
par: Wen, Tongyu, et autres
Publié: (2025)
Automating Security Audit Using Large Language Model based Agent: An Exploration Experiment
par: Chin, Jia Hui, et autres
Publié: (2025)
par: Chin, Jia Hui, et autres
Publié: (2025)
When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations
par: Ge, Huaizhi, et autres
Publié: (2024)
par: Ge, Huaizhi, et autres
Publié: (2024)
Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents
par: Maloyan, Narek, et autres
Publié: (2026)
par: Maloyan, Narek, et autres
Publié: (2026)
PromptArmor: Simple yet Effective Prompt Injection Defenses
par: Shi, Tianneng, et autres
Publié: (2025)
par: Shi, Tianneng, et autres
Publié: (2025)
On the Consistency of GNN Explanations for Malware Detection
par: Shokouhinejad, Hossein, et autres
Publié: (2025)
par: Shokouhinejad, Hossein, et autres
Publié: (2025)
SLIFER: Investigating Performance and Robustness of Malware Detection Pipelines
par: Ponte, Andrea, et autres
Publié: (2024)
par: Ponte, Andrea, et autres
Publié: (2024)
DataSentinel: A Game-Theoretic Detection of Prompt Injection Attacks
par: Liu, Yupei, et autres
Publié: (2025)
par: Liu, Yupei, et autres
Publié: (2025)
Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents
par: Crawford, Brian, et autres
Publié: (2026)
par: Crawford, Brian, et autres
Publié: (2026)
A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection
par: Zhang, Ivan
Publié: (2025)
par: Zhang, Ivan
Publié: (2025)
SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents
par: Du, Mengyao, et autres
Publié: (2026)
par: Du, Mengyao, et autres
Publié: (2026)
Extending XReason: Formal Explanations for Adversarial Detection
par: Jemaa, Amira, et autres
Publié: (2024)
par: Jemaa, Amira, et autres
Publié: (2024)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025)
par: Wang, Zhaoqi, et autres
Publié: (2025)
Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
par: Shan, Shawn, et autres
Publié: (2023)
par: Shan, Shawn, et autres
Publié: (2023)
Elijah: Eliminating Backdoors Injected in Diffusion Models via Distribution Shift
par: An, Shengwei, et autres
Publié: (2023)
par: An, Shengwei, et autres
Publié: (2023)
PromptLocate: Localizing Prompt Injection Attacks
par: Jia, Yuqi, et autres
Publié: (2025)
par: Jia, Yuqi, et autres
Publié: (2025)
PromptKeeper: Safeguarding System Prompts for LLMs
par: Jiang, Zhifeng, et autres
Publié: (2024)
par: Jiang, Zhifeng, et autres
Publié: (2024)
ChatGPT's Potential in Cryptography Misuse Detection: A Comparative Analysis with Static Analysis Tools
par: Firouzi, Ehsan, et autres
Publié: (2024)
par: Firouzi, Ehsan, et autres
Publié: (2024)
OMNISEC: LLM-Driven Provenance-based Intrusion Detection via Retrieval-Augmented Behavior Prompting
par: Cheng, Wenrui, et autres
Publié: (2025)
par: Cheng, Wenrui, et autres
Publié: (2025)
Documents similaires
-
Enhancing Reasoning Capacity of SLM using Cognitive Enhancement
par: Pan, Jonathan, et autres
Publié: (2024) -
Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States
par: Chia, Xin Wei, et autres
Publié: (2025) -
Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs
par: Pallakonda, Bhanu, et autres
Publié: (2026) -
LLMail-Inject: A Dataset from a Realistic Adaptive Prompt Injection Challenge
par: Abdelnabi, Sahar, et autres
Publié: (2025) -
AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs
par: Wang, Che, et autres
Publié: (2026)