Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
Fuente:
arXiv
Saved in:
| Main Authors: | Zeng, Zhengran, Li, Yixin, Xie, Rui, Ye, Wei, Zhang, Shikun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking and Studying the LLM-based Code Review
by: Zeng, Zhengran, et al.
Published: (2025)
by: Zeng, Zhengran, et al.
Published: (2025)
An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models
by: Xing, Chengli, et al.
Published: (2026)
by: Xing, Chengli, et al.
Published: (2026)
Seed&Steer: Guiding Large Language Models with Compilable Prefix and Branch Signals for Unit Test Generation
by: Zhou, Shuaiyu, et al.
Published: (2025)
by: Zhou, Shuaiyu, et al.
Published: (2025)
CodeShell Technical Report
by: Xie, Rui, et al.
Published: (2024)
by: Xie, Rui, et al.
Published: (2024)
CoderUJB: An Executable and Unified Java Benchmark for Practical Programming Scenarios
by: Zeng, Zhengran, et al.
Published: (2024)
by: Zeng, Zhengran, et al.
Published: (2024)
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
by: Liu, Junwei, et al.
Published: (2025)
by: Liu, Junwei, et al.
Published: (2025)
A Viable Paradigm of Software Automation: Iterative End-to-End Automated Software Development
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
ISC4DGF: Enhancing Directed Grey-box Fuzzing with LLM-Driven Initial Seed Corpus Generation
by: Xu, Yijiang, et al.
Published: (2024)
by: Xu, Yijiang, et al.
Published: (2024)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
by: Liu, Jingyao, et al.
Published: (2025)
by: Liu, Jingyao, et al.
Published: (2025)
End-to-End Automated Logging via Multi-Agent Framework
by: Zhong, Renyi, et al.
Published: (2025)
by: Zhong, Renyi, et al.
Published: (2025)
MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration
by: Zhang, Chenmu, et al.
Published: (2026)
by: Zhang, Chenmu, et al.
Published: (2026)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
by: Hu, Ruida, et al.
Published: (2026)
by: Hu, Ruida, et al.
Published: (2026)
RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
by: Peng, Zhiyuan, et al.
Published: (2026)
by: Peng, Zhiyuan, et al.
Published: (2026)
Multi-Agent End-to-End Vulnerability Management for Mitigating Recurring Vulnerabilities
by: Zheng, Zelong, et al.
Published: (2026)
by: Zheng, Zelong, et al.
Published: (2026)
Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation
by: Xu, Qinghua, et al.
Published: (2025)
by: Xu, Qinghua, et al.
Published: (2025)
The Impact of Human Aspects on the Interactions Between Software Developers and End-Users in Software Engineering: A Systematic Literature Review
by: Gunatilake, Hashini, et al.
Published: (2024)
by: Gunatilake, Hashini, et al.
Published: (2024)
FastLog: An End-to-End Method to Efficiently Generate and Insert Logging Statements
by: Xie, Xiaoyuan, et al.
Published: (2023)
by: Xie, Xiaoyuan, et al.
Published: (2023)
OneLog: Towards End-to-End Training in Software Log Anomaly Detection
by: Hashemi, Shayan, et al.
Published: (2021)
by: Hashemi, Shayan, et al.
Published: (2021)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
by: Guo, Hanyang, et al.
Published: (2025)
by: Guo, Hanyang, et al.
Published: (2025)
A Survey on Evaluating Large Language Models in Code Generation Tasks
by: Chen, Liguo, et al.
Published: (2024)
by: Chen, Liguo, et al.
Published: (2024)
Agents in the Sandbox: End-to-End Crash Bug Reproduction for Minecraft
by: Yapağcı, Eray, et al.
Published: (2025)
by: Yapağcı, Eray, et al.
Published: (2025)
Analyzing Code Injection Attacks on LLM-based Multi-Agent Systems in Software Development
by: Bowers, Brian, et al.
Published: (2025)
by: Bowers, Brian, et al.
Published: (2025)
A Comprehensive Evaluation of Four End-to-End AI Autopilots Using CCTest and the Carla Leaderboard
by: Li, Changwen, et al.
Published: (2025)
by: Li, Changwen, et al.
Published: (2025)
Self-Organizing Multi-Agent Systems for Continuous Software Development
by: Lyu, Wenhan, et al.
Published: (2026)
by: Lyu, Wenhan, et al.
Published: (2026)
Feature-Driven End-To-End Test Generation
by: Alian, Parsa, et al.
Published: (2024)
by: Alian, Parsa, et al.
Published: (2024)
United We Stand: Towards End-to-End Log-based Fault Diagnosis via Interactive Multi-Task Learning
by: He, Minghua, et al.
Published: (2025)
by: He, Minghua, et al.
Published: (2025)
FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
by: Zhu, Hongda, et al.
Published: (2025)
by: Zhu, Hongda, et al.
Published: (2025)
WEFix: Intelligent Automatic Generation of Explicit Waits for Efficient Web End-to-End Flaky Tests
by: Liu, Xinyue, et al.
Published: (2024)
by: Liu, Xinyue, et al.
Published: (2024)
GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair
by: Liu, Zhuoyao, et al.
Published: (2026)
by: Liu, Zhuoyao, et al.
Published: (2026)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
by: Guo, JunJia, et al.
Published: (2026)
by: Guo, JunJia, et al.
Published: (2026)
VISCA: Inferring Component Abstractions for Automated End-to-End Testing
by: Alian, Parsa, et al.
Published: (2025)
by: Alian, Parsa, et al.
Published: (2025)
CCISolver: End-to-End Detection and Repair of Method-Level Code-Comment Inconsistency
by: Zhong, Renyi, et al.
Published: (2025)
by: Zhong, Renyi, et al.
Published: (2025)
An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor
by: Li, Zhuang, et al.
Published: (2026)
by: Li, Zhuang, et al.
Published: (2026)
RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale
by: Chen, Zhilong, et al.
Published: (2025)
by: Chen, Zhilong, et al.
Published: (2025)
UCAgent: An End-to-End Agent for Block-Level Functional Verification
by: Wang, Junyue, et al.
Published: (2026)
by: Wang, Junyue, et al.
Published: (2026)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
by: Yu, Zhuohao, et al.
Published: (2024)
by: Yu, Zhuohao, et al.
Published: (2024)
UniAda: Universal Adaptive Multi-objective Adversarial Attack for End-to-End Autonomous Driving Systems
by: Zhang, Jingyu, et al.
Published: (2026)
by: Zhang, Jingyu, et al.
Published: (2026)
Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining
by: Zeng, Zhiyuan, et al.
Published: (2026)
by: Zeng, Zhiyuan, et al.
Published: (2026)
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
Similar Items
-
Benchmarking and Studying the LLM-based Code Review
by: Zeng, Zhengran, et al.
Published: (2025) -
An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models
by: Xing, Chengli, et al.
Published: (2026) -
Seed&Steer: Guiding Large Language Models with Compilable Prefix and Branch Signals for Unit Test Generation
by: Zhou, Shuaiyu, et al.
Published: (2025) -
CodeShell Technical Report
by: Xie, Rui, et al.
Published: (2024) -
CoderUJB: An Executable and Unified Java Benchmark for Practical Programming Scenarios
by: Zeng, Zhengran, et al.
Published: (2024)