What Makes a Good LLM Agent for Real-world Penetration Testing?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Gelei, Liu, Yi, Li, Yuekang, Yang, Ruozhao, Xie, Xiaofei, Zhang, Jie, Qiu, Han, Zhang, Tianwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
par: Yang, Ruozhao, et autres
Publié: (2025)
par: Yang, Ruozhao, et autres
Publié: (2025)
PentestGPT: An LLM-empowered Automatic Penetration Testing Tool
par: Deng, Gelei, et autres
Publié: (2023)
par: Deng, Gelei, et autres
Publié: (2023)
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
par: Yang, Ruozhao, et autres
Publié: (2026)
par: Yang, Ruozhao, et autres
Publié: (2026)
Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks
par: Qu, Yubin, et autres
Publié: (2026)
par: Qu, Yubin, et autres
Publié: (2026)
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
Prompt Injection attack against LLM-integrated Applications
par: Liu, Yi, et autres
Publié: (2023)
par: Liu, Yi, et autres
Publié: (2023)
ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection
par: Weng, Shihao, et autres
Publié: (2026)
par: Weng, Shihao, et autres
Publié: (2026)
Automated Penetration Testing: Formalization and Realization
par: Skandylas, Charilaos, et autres
Publié: (2024)
par: Skandylas, Charilaos, et autres
Publié: (2024)
Groot: Adversarial Testing for Generative Text-to-Image Models with Tree-based Semantic Transformation
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
SAVANT: Vulnerability Detection in Application Dependencies through Semantic-Guided Reachability Analysis
par: Lingxiang, Wang, et autres
Publié: (2025)
par: Lingxiang, Wang, et autres
Publié: (2025)
Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing
par: Peng, Jiaren, et autres
Publié: (2026)
par: Peng, Jiaren, et autres
Publié: (2026)
Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety
par: Chen, Xuan, et autres
Publié: (2026)
par: Chen, Xuan, et autres
Publié: (2026)
From LLMs to Agents: A Comparative Evaluation of LLMs and LLM-based Agents in Security Patch Detection
par: Han, Junxiao, et autres
Publié: (2025)
par: Han, Junxiao, et autres
Publié: (2025)
Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities
par: Ma, Yujie, et autres
Publié: (2026)
par: Ma, Yujie, et autres
Publié: (2026)
PatchFuzz: Patch Fuzzing for JavaScript Engines
par: Wang, Junjie, et autres
Publié: (2025)
par: Wang, Junjie, et autres
Publié: (2025)
MiniScope: Automated UI Exploration and Privacy Inconsistency Detection of MiniApps via Two-phase Iterative Hybrid Analysis
par: Wang, Shenao, et autres
Publié: (2024)
par: Wang, Shenao, et autres
Publié: (2024)
Towards Understanding and Characterizing Vulnerabilities in Intelligent Connected Vehicles through Real-World Exploits
par: Wang, Yuelin, et autres
Publié: (2026)
par: Wang, Yuelin, et autres
Publié: (2026)
Unlocking User-oriented Pages: Intention-driven Black-box Scanner for Real-world Web Applications
par: Wang, Weizhe, et autres
Publié: (2025)
par: Wang, Weizhe, et autres
Publié: (2025)
FidelityGPT: Correcting Decompilation Distortions with Retrieval Augmented Generation
par: Zhou, Zhiping, et autres
Publié: (2025)
par: Zhou, Zhiping, et autres
Publié: (2025)
Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent
par: Xuan, Zhou, et autres
Publié: (2026)
par: Xuan, Zhou, et autres
Publié: (2026)
Cochise: A Reference Harness for Autonomous Penetration Testing
par: Happe, Andreas, et autres
Publié: (2026)
par: Happe, Andreas, et autres
Publié: (2026)
OpDiffer: LLM-Assisted Opcode-Level Differential Testing of Ethereum Virtual Machine
par: Ma, Jie, et autres
Publié: (2025)
par: Ma, Jie, et autres
Publié: (2025)
ContractTinker: LLM-Empowered Vulnerability Repair for Real-World Smart Contracts
par: Wang, Che, et autres
Publié: (2024)
par: Wang, Che, et autres
Publié: (2024)
QASecClaw: A Multi-Agent LLM Approach for False Positive Reduction in Static Application Security Testing
par: Ameen, Mohd Ruhul, et autres
Publié: (2026)
par: Ameen, Mohd Ruhul, et autres
Publié: (2026)
SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
par: Hu, Qi, et autres
Publié: (2026)
par: Hu, Qi, et autres
Publié: (2026)
A Large Scale Study of AI-based Binary Function Similarity Detection Techniques for Security Researchers and Practitioners
par: Shi, Jingyi, et autres
Publié: (2025)
par: Shi, Jingyi, et autres
Publié: (2025)
Understanding the Supply Chain and Risks of Large Language Model Applications
par: Ma, Yujie, et autres
Publié: (2025)
par: Ma, Yujie, et autres
Publié: (2025)
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
par: Ge, Yifei, et autres
Publié: (2026)
par: Ge, Yifei, et autres
Publié: (2026)
HarnessAgent: Scaling Automatic Fuzzing Harness Construction with Tool-Augmented LLM Pipelines
par: Yang, Kang, et autres
Publié: (2025)
par: Yang, Kang, et autres
Publié: (2025)
FCGHunter: Towards Evaluating Robustness of Graph-Based Android Malware Detection
par: Song, Shiwen, et autres
Publié: (2025)
par: Song, Shiwen, et autres
Publié: (2025)
CAShift: Benchmarking Log-Based Cloud Attack Detection under Normality Shift
par: Yu, Jiongchi, et autres
Publié: (2025)
par: Yu, Jiongchi, et autres
Publié: (2025)
Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation
par: Yu, Jiongchi, et autres
Publié: (2025)
par: Yu, Jiongchi, et autres
Publié: (2025)
CHASE: LLM Agents for Dissecting Malicious PyPI Packages
par: Toda, Takaaki, et autres
Publié: (2026)
par: Toda, Takaaki, et autres
Publié: (2026)
LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?
par: Liu, Bin, et autres
Publié: (2025)
par: Liu, Bin, et autres
Publié: (2025)
Multi-Agent Collaborative Fuzzing with Continuous Reflection for Smart Contracts Vulnerability Detection
par: Chen, Jie, et autres
Publié: (2025)
par: Chen, Jie, et autres
Publié: (2025)
Exploiting LLM Agent Supply Chains via Payload-less Skills
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
How Secure is Secure Code Generation? Adversarial Prompts Put LLM Defenses to the Test
par: Tessa, Melissa, et autres
Publié: (2026)
par: Tessa, Melissa, et autres
Publié: (2026)
Verbatim Data Transcription Failures in LLM Code Generation: A State-Tracking Stress Test
par: Haque, Mohd Ariful, et autres
Publié: (2026)
par: Haque, Mohd Ariful, et autres
Publié: (2026)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
par: Wang, Yanlin, et autres
Publié: (2026)
par: Wang, Yanlin, et autres
Publié: (2026)
ChainFuzzer: Greybox Fuzzing for Workflow-Level Multi-Tool Vulnerabilities in LLM Agents
par: Wu, Jiangrong, et autres
Publié: (2026)
par: Wu, Jiangrong, et autres
Publié: (2026)
Documents similaires
-
PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
par: Yang, Ruozhao, et autres
Publié: (2025) -
PentestGPT: An LLM-empowered Automatic Penetration Testing Tool
par: Deng, Gelei, et autres
Publié: (2023) -
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
par: Yang, Ruozhao, et autres
Publié: (2026) -
Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks
par: Qu, Yubin, et autres
Publié: (2026) -
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
par: Liu, Yi, et autres
Publié: (2026)