The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sah, Tanmay, Srivastava, Vishal, Sah, Dolly, Jordan, Kayden |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Variable Record Table: A Unified Hardware-Assisted Framework for Runtime Security
par: Sah, Suraj Kumar, et autres
Publié: (2025)
par: Sah, Suraj Kumar, et autres
Publié: (2025)
Enhancing Cybersecurity in Critical Infrastructure with LLM-Assisted Explainable IoT Systems
par: Ghimire, Ashutosh, et autres
Publié: (2025)
par: Ghimire, Ashutosh, et autres
Publié: (2025)
Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
par: Jiang, Laura, et autres
Publié: (2026)
par: Jiang, Laura, et autres
Publié: (2026)
MalTool: Malicious Tool Attacks on LLM Agents
par: Hu, Yuepeng, et autres
Publié: (2026)
par: Hu, Yuepeng, et autres
Publié: (2026)
VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit
par: Lin, Junda, et autres
Publié: (2026)
par: Lin, Junda, et autres
Publié: (2026)
ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
par: Chen, Zhaorun, et autres
Publié: (2025)
par: Chen, Zhaorun, et autres
Publié: (2025)
Imprompter: Tricking LLM Agents into Improper Tool Use
par: Fu, Xiaohan, et autres
Publié: (2024)
par: Fu, Xiaohan, et autres
Publié: (2024)
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025)
par: Shi, Jiawen, et autres
Publié: (2025)
Les Dissonances: Cross-Tool Harvesting and Polluting in Pool-of-Tools Empowered LLM Agents
par: Li, Zichuan, et autres
Publié: (2025)
par: Li, Zichuan, et autres
Publié: (2025)
Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety
par: Chen, Xuan, et autres
Publié: (2026)
par: Chen, Xuan, et autres
Publié: (2026)
Secure Tool Manifest and Digital Signing Solution for Verifiable MCP and LLM Pipelines
par: Jamshidi, Saeid, et autres
Publié: (2026)
par: Jamshidi, Saeid, et autres
Publié: (2026)
The Autonomy Tax: Defense Training Breaks LLM Agents
par: Li, Shawn, et autres
Publié: (2026)
par: Li, Shawn, et autres
Publié: (2026)
Quantifying Automation Risk in High-Automation AI Systems: A Bayesian Framework for Failure Propagation and Optimal Oversight
par: Srivastava, Vishal, et autres
Publié: (2026)
par: Srivastava, Vishal, et autres
Publié: (2026)
AgentGuard: An Attribute-Based Access Control Framework for Tool-Use LLM-Based Agent
par: Luo, Jiaqi, et autres
Publié: (2026)
par: Luo, Jiaqi, et autres
Publié: (2026)
ToolTweak: An Attack on Tool Selection in LLM-based Agents
par: Sneh, Jonathan, et autres
Publié: (2025)
par: Sneh, Jonathan, et autres
Publié: (2025)
LaSDVS : A Post-Quantum Secure Compact Strong-Designated Verifier Signature
par: Poddar, Shanu, et autres
Publié: (2025)
par: Poddar, Shanu, et autres
Publié: (2025)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
par: Yang, Chenglin
Publié: (2026)
par: Yang, Chenglin
Publié: (2026)
Listening Alone, Understanding Together: Collaborative Context Recovery for Privacy-Aware AI
par: Srivastava, Tanmay, et autres
Publié: (2026)
par: Srivastava, Tanmay, et autres
Publié: (2026)
Memory-Induced Tool-Drift in LLM Agents
par: Dabas, Mahavir, et autres
Publié: (2026)
par: Dabas, Mahavir, et autres
Publié: (2026)
SOCpilot: Verifying Policy Compliance for LLM-Assisted Incident Response
par: Barbieri, Sidnei, et autres
Publié: (2026)
par: Barbieri, Sidnei, et autres
Publié: (2026)
Attesting LLM Pipelines: Enforcing Verifiable Training and Release Claims
par: Tan, Zhuoran, et autres
Publié: (2026)
par: Tan, Zhuoran, et autres
Publié: (2026)
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
par: Liu, Yuexiao, et autres
Publié: (2025)
par: Liu, Yuexiao, et autres
Publié: (2025)
Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards
par: Normann, Philipp, et autres
Publié: (2026)
par: Normann, Philipp, et autres
Publié: (2026)
Hardware-Enabled Mechanisms for Verifying Responsible AI Development
par: O'Gara, Aidan, et autres
Publié: (2025)
par: O'Gara, Aidan, et autres
Publié: (2025)
Differential Privacy in Generative AI Agents: Analysis and Optimal Tradeoffs
par: Yang, Ya-Ting, et autres
Publié: (2026)
par: Yang, Ya-Ting, et autres
Publié: (2026)
Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
par: Yan, Lecheng, et autres
Publié: (2026)
par: Yan, Lecheng, et autres
Publié: (2026)
AgentGuard: Repurposing Agentic Orchestrator for Safety Evaluation of Tool Orchestration
par: Chen, Jizhou, et autres
Publié: (2025)
par: Chen, Jizhou, et autres
Publié: (2025)
VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation
par: Miculicich, Lesly, et autres
Publié: (2025)
par: Miculicich, Lesly, et autres
Publié: (2025)
AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations
par: He, Yu, et autres
Publié: (2026)
par: He, Yu, et autres
Publié: (2026)
A Post-Quantum Secure End-to-End Verifiable E-Voting Protocol Based on Multivariate Polynomials
par: Srivastava, Vikas, et autres
Publié: (2025)
par: Srivastava, Vikas, et autres
Publié: (2025)
Towards a Benchmark for Dependency Decision-Making
par: Singla, Tanmay, et autres
Publié: (2026)
par: Singla, Tanmay, et autres
Publié: (2026)
AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents
par: Rassul, Yassin H., et autres
Publié: (2026)
par: Rassul, Yassin H., et autres
Publié: (2026)
OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents
par: Li, Frank
Publié: (2026)
par: Li, Frank
Publié: (2026)
DP-FlogTinyLLM: Differentially private federated log anomaly detection using Tiny LLMs
par: Thompson, Isaiah, et autres
Publié: (2026)
par: Thompson, Isaiah, et autres
Publié: (2026)
From CVE Entries to Verifiable Exploits: An Automated Multi-Agent Framework for Reproducing CVEs
par: Ullah, Saad, et autres
Publié: (2025)
par: Ullah, Saad, et autres
Publié: (2025)
Incorporation of Verifier Functionality in the Software for Operations and Network Attack Results Review and the Autonomous Penetration Testing System
par: Milbrath, Jordan, et autres
Publié: (2024)
par: Milbrath, Jordan, et autres
Publié: (2024)
RiskHarvester: A Risk-based Tool to Prioritize Secret Removal Efforts in Software Artifacts
par: Basak, Setu Kumar, et autres
Publié: (2025)
par: Basak, Setu Kumar, et autres
Publié: (2025)
Time-Delayed Publicly Verifiable Quantum Computation for Classical Verifiers
par: Mohammed, Ameer, et autres
Publié: (2026)
par: Mohammed, Ameer, et autres
Publié: (2026)
Dependency-Aware Privacy for Multi-turn Agents
par: Anshumaan, Divyam, et autres
Publié: (2026)
par: Anshumaan, Divyam, et autres
Publié: (2026)
Causality Laundering: Denial-Feedback Leakage in Tool-Calling LLM Agents
par: Chinaei, Mohammad Hossein
Publié: (2026)
par: Chinaei, Mohammad Hossein
Publié: (2026)
Documents similaires
-
Variable Record Table: A Unified Hardware-Assisted Framework for Runtime Security
par: Sah, Suraj Kumar, et autres
Publié: (2025) -
Enhancing Cybersecurity in Critical Infrastructure with LLM-Assisted Explainable IoT Systems
par: Ghimire, Ashutosh, et autres
Publié: (2025) -
Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
par: Jiang, Laura, et autres
Publié: (2026) -
MalTool: Malicious Tool Attacks on LLM Agents
par: Hu, Yuepeng, et autres
Publié: (2026) -
VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit
par: Lin, Junda, et autres
Publié: (2026)