AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Yang, Chenglin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AgentWall: A Runtime Safety Layer for Local AI Agents
par: Aravind, Ashwin
Publié: (2026)
par: Aravind, Ashwin
Publié: (2026)
AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
par: Zhuang, Haomin, et autres
Publié: (2026)
par: Zhuang, Haomin, et autres
Publié: (2026)
AgentGuard: Repurposing Agentic Orchestrator for Safety Evaluation of Tool Orchestration
par: Chen, Jizhou, et autres
Publié: (2025)
par: Chen, Jizhou, et autres
Publié: (2025)
IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection
par: Chia-Pei, et autres
Publié: (2026)
par: Chia-Pei, et autres
Publié: (2026)
ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection
par: Zhao, Wei, et autres
Publié: (2026)
par: Zhao, Wei, et autres
Publié: (2026)
Securing GenAI Multi-Agent Systems Against Tool Squatting: A Zero Trust Registry-Based Approach
par: Narajala, Vineeth Sai, et autres
Publié: (2025)
par: Narajala, Vineeth Sai, et autres
Publié: (2025)
Trusted AI Agents in the Cloud
par: Bodea, Teofil, et autres
Publié: (2025)
par: Bodea, Teofil, et autres
Publié: (2025)
AIRGuard: Guarding Agent Actions with Runtime Authority Control
par: Qin, Suliu, et autres
Publié: (2026)
par: Qin, Suliu, et autres
Publié: (2026)
Safeguarding AI Agents: Developing and Analyzing Safety Architectures
par: Domkundwar, Ishaan, et autres
Publié: (2024)
par: Domkundwar, Ishaan, et autres
Publié: (2024)
Evaluating Privilege Usage of Agents with Real-World Tools
par: Zhang, Quan, et autres
Publié: (2026)
par: Zhang, Quan, et autres
Publié: (2026)
Caging the Agents: A Zero Trust Security Architecture for Autonomous AI in Healthcare
par: Maiti, Saikat
Publié: (2026)
par: Maiti, Saikat
Publié: (2026)
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
par: Ding, Xuwei, et autres
Publié: (2026)
par: Ding, Xuwei, et autres
Publié: (2026)
Toward a Unified Security Framework for AI Agents: Trust, Risk, and Liability
par: Mo, Jiayun, et autres
Publié: (2025)
par: Mo, Jiayun, et autres
Publié: (2025)
A Comparative Evaluation of AI Agent Security Guardrails
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents
par: Uchibeke, Uchi
Publié: (2026)
par: Uchibeke, Uchi
Publié: (2026)
Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
par: Jin, Xisen, et autres
Publié: (2026)
par: Jin, Xisen, et autres
Publié: (2026)
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025)
par: Sneh, Jonathan, et autres
Publié: (2025)
OpenPort Protocol: A Security Governance Specification for AI Agent Tool Access
par: Zhu, Genliang, et autres
Publié: (2026)
par: Zhu, Genliang, et autres
Publié: (2026)
Your LLM Agent Can Leak Your Data: Data Exfiltration via Backdoored Tool Use
par: Zhang, Wuyang, et autres
Publié: (2026)
par: Zhang, Wuyang, et autres
Publié: (2026)
Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives
par: Son, Daeyeon
Publié: (2026)
par: Son, Daeyeon
Publié: (2026)
SoK: Trust-Authorization Mismatch in LLM Agent Interactions
par: Shi, Guanquan, et autres
Publié: (2025)
par: Shi, Guanquan, et autres
Publié: (2025)
Security Risks in Tool-Enabled AI Agents: A Systematic Analysis of Privileged Execution Environments
par: Goel, Hardik
Publié: (2026)
par: Goel, Hardik
Publié: (2026)
Security of AI Agents
par: He, Yifeng, et autres
Publié: (2024)
par: He, Yifeng, et autres
Publié: (2024)
Autonomous Action Runtime Management(AARM):A System Specification for Securing AI-Driven Actions at Runtime
par: Errico, Herman
Publié: (2026)
par: Errico, Herman
Publié: (2026)
Agent Safety Alignment via Reinforcement Learning
par: Sha, Zeyang, et autres
Publié: (2025)
par: Sha, Zeyang, et autres
Publié: (2025)
Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents
par: Jiang, Linxi, et autres
Publié: (2026)
par: Jiang, Linxi, et autres
Publié: (2026)
Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents
par: Aonzo, Simone, et autres
Publié: (2026)
par: Aonzo, Simone, et autres
Publié: (2026)
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
par: Reworr, et autres
Publié: (2024)
par: Reworr, et autres
Publié: (2024)
Mind the Web: The Security of Web Use Agents
par: Shapira, Avishag, et autres
Publié: (2025)
par: Shapira, Avishag, et autres
Publié: (2025)
Measuring Safety Alignment Effects in Autonomous Security Agents
par: David, Isaac, et autres
Publié: (2026)
par: David, Isaac, et autres
Publié: (2026)
AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents
par: Zhang, Yixiang, et autres
Publié: (2026)
par: Zhang, Yixiang, et autres
Publié: (2026)
AudAgent: Automated Auditing of Privacy Policy Compliance in AI Agents
par: Zheng, Ye, et autres
Publié: (2025)
par: Zheng, Ye, et autres
Publié: (2025)
Zero-Trust Runtime Verification for Agentic Payment Protocols: Mitigating Replay and Context-Binding Failures in AP2
par: Lan, Qianlong, et autres
Publié: (2026)
par: Lan, Qianlong, et autres
Publié: (2026)
Differential Privacy in Generative AI Agents: Analysis and Optimal Tradeoffs
par: Yang, Ya-Ting, et autres
Publié: (2026)
par: Yang, Ya-Ting, et autres
Publié: (2026)
A2AS: Agentic AI Runtime Security and Self-Defense
par: Neelou, Eugene, et autres
Publié: (2025)
par: Neelou, Eugene, et autres
Publié: (2025)
FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
par: Yang, Zhi, et autres
Publié: (2026)
par: Yang, Zhi, et autres
Publié: (2026)
ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation
par: Jiang, Xiaochong, et autres
Publié: (2026)
par: Jiang, Xiaochong, et autres
Publié: (2026)
Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space
par: Zhou, Xingfu, et autres
Publié: (2025)
par: Zhou, Xingfu, et autres
Publié: (2025)
Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes
par: Metere, Alfredo
Publié: (2026)
par: Metere, Alfredo
Publié: (2026)
Secret Collusion among AI Agents: Multi-Agent Deception via Steganography
par: Motwani, Sumeet Ramesh, et autres
Publié: (2024)
par: Motwani, Sumeet Ramesh, et autres
Publié: (2024)
Documents similaires
-
AgentWall: A Runtime Safety Layer for Local AI Agents
par: Aravind, Ashwin
Publié: (2026) -
AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
par: Zhuang, Haomin, et autres
Publié: (2026) -
AgentGuard: Repurposing Agentic Orchestrator for Safety Evaluation of Tool Orchestration
par: Chen, Jizhou, et autres
Publié: (2025) -
IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection
par: Chia-Pei, et autres
Publié: (2026) -
ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection
par: Zhao, Wei, et autres
Publié: (2026)