A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Jiale, Huang, Suizhi, Li, Mei, Huang, Dong, Chen, Xingsheng, Zhang, Regina, Guo, Zhijiang, Yu, Han, Yiu, Siu-Ming, Lio, Pietro, Lam, Kwok-Yan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
by: Guo, Dongxin, et al.
Published: (2026)
by: Guo, Dongxin, et al.
Published: (2026)
A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era
by: Li, Zongru, et al.
Published: (2026)
by: Li, Zongru, et al.
Published: (2026)
MODE: Efficient Time Series Prediction with Mamba Enhanced by Low-Rank Neural ODEs
by: Chen, Xingsheng, et al.
Published: (2026)
by: Chen, Xingsheng, et al.
Published: (2026)
Advances and Frontiers of LLM-based Issue Resolution in Software Engineering: A Comprehensive Survey
by: Li, Caihua, et al.
Published: (2026)
by: Li, Caihua, et al.
Published: (2026)
LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities
by: Tang, Yongjian, et al.
Published: (2026)
by: Tang, Yongjian, et al.
Published: (2026)
Towards Comprehensive Benchmarking Infrastructure for LLMs In Software Engineering
by: Rodriguez-Cardenas, Daniel, et al.
Published: (2026)
by: Rodriguez-Cardenas, Daniel, et al.
Published: (2026)
From Bugs to Benchmarks: A Comprehensive Survey of Software Defect Datasets
by: Zhu, Hao-Nan, et al.
Published: (2025)
by: Zhu, Hao-Nan, et al.
Published: (2025)
Coverage-Guided Testing for Deep Learning Models: A Comprehensive Survey
by: Guo, Hongjing, et al.
Published: (2025)
by: Guo, Hongjing, et al.
Published: (2025)
A Comprehensive Survey of Benchmarks for Automated Improvement of Software's Non-Functional Properties
by: Blot, Aymeric, et al.
Published: (2022)
by: Blot, Aymeric, et al.
Published: (2022)
Rethinking Software Engineering for Agentic AI Systems
by: Alenezi, Mamdouh
Published: (2026)
by: Alenezi, Mamdouh
Published: (2026)
GeoCert: Certified Geometric AI for Reliable Forecasting
by: Zhang, Regina, et al.
Published: (2026)
by: Zhang, Regina, et al.
Published: (2026)
Generative Software Engineering
by: Huang, Yuan, et al.
Published: (2024)
by: Huang, Yuan, et al.
Published: (2024)
From LLMs to LLM-based Agents for Software Engineering: A Survey of Current, Challenges and Future
by: Jin, Haolin, et al.
Published: (2024)
by: Jin, Haolin, et al.
Published: (2024)
Teaching Survey Research in Software Engineering
by: Kalinowski, Marcos, et al.
Published: (2024)
by: Kalinowski, Marcos, et al.
Published: (2024)
Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering
by: Bhati, Happy
Published: (2026)
by: Bhati, Happy
Published: (2026)
Agentic AI Software Engineers: Programming with Trust
by: Roychoudhury, Abhik, et al.
Published: (2025)
by: Roychoudhury, Abhik, et al.
Published: (2025)
Agentic Pipelines in Embedded Software Engineering: Emerging Practices and Challenges
by: Sun, Simin, et al.
Published: (2026)
by: Sun, Simin, et al.
Published: (2026)
Assured LLM-Based Software Engineering
by: Alshahwan, Nadia, et al.
Published: (2024)
by: Alshahwan, Nadia, et al.
Published: (2024)
Quantum Optimization for Software Engineering: A Survey
by: Zhang, Man, et al.
Published: (2025)
by: Zhang, Man, et al.
Published: (2025)
A Survey of Reinforcement Learning for Software Engineering
by: Wang, Dong, et al.
Published: (2025)
by: Wang, Dong, et al.
Published: (2025)
The Software Engineering Simulations Lab: Agentic AI for RE Quality Simulations
by: Femmer, Henning, et al.
Published: (2025)
by: Femmer, Henning, et al.
Published: (2025)
Agint: Agentic Graph Compilation for Software Engineering Agents
by: Chivukula, Abhi, et al.
Published: (2025)
by: Chivukula, Abhi, et al.
Published: (2025)
Agents in Software Engineering: Survey, Landscape, and Vision
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
Agentic AI for Software: thoughts from Software Engineering community
by: Roychoudhury, Abhik
Published: (2025)
by: Roychoudhury, Abhik
Published: (2025)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
by: Qiu, Jielin, et al.
Published: (2025)
by: Qiu, Jielin, et al.
Published: (2025)
A Survey on Large Language Models for Software Engineering
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
Comprehension Debt in GenAI-Assisted Software Engineering Projects
by: Ahmad, Muhammad Ovais
Published: (2026)
by: Ahmad, Muhammad Ovais
Published: (2026)
SELU: A Software Engineering Language Understanding Benchmark
by: Peña, Fabian C., et al.
Published: (2025)
by: Peña, Fabian C., et al.
Published: (2025)
Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering
by: Li, Jingyue, et al.
Published: (2026)
by: Li, Jingyue, et al.
Published: (2026)
Agentic Software Engineering: Foundational Pillars and a Research Roadmap
by: Hassan, Ahmed E., et al.
Published: (2025)
by: Hassan, Ahmed E., et al.
Published: (2025)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
by: Chen, Zaoyu, et al.
Published: (2026)
by: Chen, Zaoyu, et al.
Published: (2026)
The Essence of Software Engineering
Published: (2018)
Published: (2018)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
by: Adamenko, Pavel, et al.
Published: (2025)
by: Adamenko, Pavel, et al.
Published: (2025)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
by: Wang, Ruiqi, et al.
Published: (2025)
by: Wang, Ruiqi, et al.
Published: (2025)
Emotional Strain and Frustration in LLM Interactions in Software Engineering
by: Montes, Cristina Martinez, et al.
Published: (2025)
by: Montes, Cristina Martinez, et al.
Published: (2025)
"ENERGY STAR" LLM-Enabled Software Engineering Tools
by: Thakur, Himon, et al.
Published: (2026)
by: Thakur, Himon, et al.
Published: (2026)
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
Agentic Software Issue Resolution with Large Language Models: A Survey
by: Jiang, Zhonghao, et al.
Published: (2025)
by: Jiang, Zhonghao, et al.
Published: (2025)
Agentic Verification of Software Systems
by: Tu, Haoxin, et al.
Published: (2025)
by: Tu, Haoxin, et al.
Published: (2025)
The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE
by: Feldt, Robert, et al.
Published: (2026)
by: Feldt, Robert, et al.
Published: (2026)
Similar Items
-
AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
by: Guo, Dongxin, et al.
Published: (2026) -
A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era
by: Li, Zongru, et al.
Published: (2026) -
MODE: Efficient Time Series Prediction with Mamba Enhanced by Low-Rank Neural ODEs
by: Chen, Xingsheng, et al.
Published: (2026) -
Advances and Frontiers of LLM-based Issue Resolution in Software Engineering: A Comprehensive Survey
by: Li, Caihua, et al.
Published: (2026) -
LLM-Based Agentic Systems for Software Engineering: Challenges and Opportunities
by: Tang, Yongjian, et al.
Published: (2026)