From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Conde, Pedro, Branquinho, Henrique, Mazzone, Valerio, Mendes, Bruno, Baptista, André, Moniz, Nuno |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoPentester: An LLM Agent-based Framework for Automated Pentesting
par: Ginige, Yasod, et autres
Publié: (2025)
par: Ginige, Yasod, et autres
Publié: (2025)
PentestJudge: Judging Agent Behavior Against Operational Requirements
par: Caldwell, Shane, et autres
Publié: (2025)
par: Caldwell, Shane, et autres
Publié: (2025)
AutoPentest: Enhancing Vulnerability Management With Autonomous LLM Agents
par: Henke, Julius
Publié: (2025)
par: Henke, Julius
Publié: (2025)
ARACNE: An LLM-Based Autonomous Shell Pentesting Agent
par: Nieponice, Tomas, et autres
Publié: (2025)
par: Nieponice, Tomas, et autres
Publié: (2025)
PentestMCP: A Toolkit for Agentic Penetration Testing
par: Ezetta, Zachary, et autres
Publié: (2025)
par: Ezetta, Zachary, et autres
Publié: (2025)
A Preliminary Study on Using Large Language Models in Software Pentesting
par: Shashwat, Kumar, et autres
Publié: (2024)
par: Shashwat, Kumar, et autres
Publié: (2024)
Evaluating Privilege Usage of Agents with Real-World Tools
par: Zhang, Quan, et autres
Publié: (2026)
par: Zhang, Quan, et autres
Publié: (2026)
Generative Artificial Intelligence-Supported Pentesting: A Comparison between Claude Opus, GPT-4, and Copilot
par: Martínez, Antonio López, et autres
Publié: (2025)
par: Martínez, Antonio López, et autres
Publié: (2025)
Hacking, The Lazy Way: LLM Augmented Pentesting
par: Goyal, Dhruva, et autres
Publié: (2024)
par: Goyal, Dhruva, et autres
Publié: (2024)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
par: Fu, Yuchuan, et autres
Publié: (2025)
par: Fu, Yuchuan, et autres
Publié: (2025)
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
par: Reworr, et autres
Publié: (2024)
par: Reworr, et autres
Publié: (2024)
PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
par: Yang, Ruozhao, et autres
Publié: (2025)
par: Yang, Ruozhao, et autres
Publié: (2025)
CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
par: Wang, Zhun, et autres
Publié: (2025)
par: Wang, Zhun, et autres
Publié: (2025)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
par: Shen, Chihao, et autres
Publié: (2025)
par: Shen, Chihao, et autres
Publié: (2025)
AdInject: Real-World Black-Box Attacks on Web Agents via Advertising Delivery
par: Wang, Haowei, et autres
Publié: (2025)
par: Wang, Haowei, et autres
Publié: (2025)
Hybrid Machine Learning Models for Intrusion Detection in IoT: Leveraging a Real-World IoT Dataset
par: Akif, Md Ahnaf, et autres
Publié: (2025)
par: Akif, Md Ahnaf, et autres
Publié: (2025)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
par: Yao, Hongwei, et autres
Publié: (2026)
par: Yao, Hongwei, et autres
Publié: (2026)
ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation
par: Zhao, Haochen, et autres
Publié: (2026)
par: Zhao, Haochen, et autres
Publié: (2026)
LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software
par: Rashid, Syed Md Mukit, et autres
Publié: (2026)
par: Rashid, Syed Md Mukit, et autres
Publié: (2026)
Agent Control Protocol: Admission Control for Agent Actions
par: Fernandez, Marcelo
Publié: (2026)
par: Fernandez, Marcelo
Publié: (2026)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
par: Lin, Justin W., et autres
Publié: (2025)
par: Lin, Justin W., et autres
Publié: (2025)
PentestAgent: Incorporating LLM Agents to Automated Penetration Testing
par: Shen, Xiangmin, et autres
Publié: (2024)
par: Shen, Xiangmin, et autres
Publié: (2024)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
Enhancing Privacy in Federated Learning: Secure Aggregation for Real-World Healthcare Applications
par: Taiello, Riccardo, et autres
Publié: (2024)
par: Taiello, Riccardo, et autres
Publié: (2024)
Mobile GUI Agents under Real-world Threats: Are We There Yet?
par: Liu, Guohong, et autres
Publié: (2025)
par: Liu, Guohong, et autres
Publié: (2025)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
par: Yang, Chenglin
Publié: (2026)
par: Yang, Chenglin
Publié: (2026)
How stealthy is stealthy? Studying the Efficacy of Black-Box Adversarial Attacks in the Real World
par: Panebianco, Francesco, et autres
Publié: (2025)
par: Panebianco, Francesco, et autres
Publié: (2025)
Securing AI Agents with Information-Flow Control
par: Costa, Manuel, et autres
Publié: (2025)
par: Costa, Manuel, et autres
Publié: (2025)
Progent: Securing AI Agents with Privilege Control
par: Shi, Tianneng, et autres
Publié: (2025)
par: Shi, Tianneng, et autres
Publié: (2025)
MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber
par: Bhardwaj, Arth, et autres
Publié: (2025)
par: Bhardwaj, Arth, et autres
Publié: (2025)
The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents
par: Wu, Baoyuan, et autres
Publié: (2026)
par: Wu, Baoyuan, et autres
Publié: (2026)
A Comparative Evaluation of AI Agent Security Guardrails
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
AIRGuard: Guarding Agent Actions with Runtime Authority Control
par: Qin, Suliu, et autres
Publié: (2026)
par: Qin, Suliu, et autres
Publié: (2026)
Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems
par: Chang, Hongyan, et autres
Publié: (2026)
par: Chang, Hongyan, et autres
Publié: (2026)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
par: Yang, Xianglin, et autres
Publié: (2026)
par: Yang, Xianglin, et autres
Publié: (2026)
OSS-CRS: Liberating AIxCC Cyber Reasoning Systems for Real-World Open-Source Security
par: Chin, Andrew, et autres
Publié: (2026)
par: Chin, Andrew, et autres
Publié: (2026)
A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems
par: Wu, Fangzhou, et autres
Publié: (2024)
par: Wu, Fangzhou, et autres
Publié: (2024)
Federated Learning under Attack: Improving Gradient Inversion for Batch of Images
par: Leite, Luiz, et autres
Publié: (2024)
par: Leite, Luiz, et autres
Publié: (2024)
From Admission to Invariants: Measuring Deviation in Delegated Agent Systems
par: Fernandez, Marcelo
Publié: (2026)
par: Fernandez, Marcelo
Publié: (2026)
AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows
par: Ngong, Ivoline C., et autres
Publié: (2026)
par: Ngong, Ivoline C., et autres
Publié: (2026)
Documents similaires
-
AutoPentester: An LLM Agent-based Framework for Automated Pentesting
par: Ginige, Yasod, et autres
Publié: (2025) -
PentestJudge: Judging Agent Behavior Against Operational Requirements
par: Caldwell, Shane, et autres
Publié: (2025) -
AutoPentest: Enhancing Vulnerability Management With Autonomous LLM Agents
par: Henke, Julius
Publié: (2025) -
ARACNE: An LLM-Based Autonomous Shell Pentesting Agent
par: Nieponice, Tomas, et autres
Publié: (2025) -
PentestMCP: A Toolkit for Agentic Penetration Testing
par: Ezetta, Zachary, et autres
Publié: (2025)