ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
Fuente:
arXiv
Saved in:
| Main Authors: | Lu, Pengrui, Zhang, Shiqi, Hou, Yunzhong, Ye, Lyumanshan, Huang, Chaoyi, Chen, Zixi, Zeng, Ji, Jiang, Hantao, Liu, Pengfei, Wang, Yiwei, Yang, Ming-Hsuan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
by: Xu, Tianze, et al.
Published: (2025)
by: Xu, Tianze, et al.
Published: (2025)
Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
by: Zeng, Zhengran, et al.
Published: (2025)
by: Zeng, Zhengran, et al.
Published: (2025)
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
by: Guo, Hanyang, et al.
Published: (2025)
by: Guo, Hanyang, et al.
Published: (2025)
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
by: Liu, Junwei, et al.
Published: (2025)
by: Liu, Junwei, et al.
Published: (2025)
Multiscale Feature Importance-based Bit Allocation for End-to-End Feature Coding for Machines
by: Liu, Junle, et al.
Published: (2025)
by: Liu, Junle, et al.
Published: (2025)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
by: Kumarappan, Adarsh, et al.
Published: (2026)
by: Kumarappan, Adarsh, et al.
Published: (2026)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
by: Jin, Tengjun, et al.
Published: (2025)
by: Jin, Tengjun, et al.
Published: (2025)
REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers
by: Leng, Xingjian, et al.
Published: (2025)
by: Leng, Xingjian, et al.
Published: (2025)
DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation
by: jiao, Jiajun, et al.
Published: (2026)
by: jiao, Jiajun, et al.
Published: (2026)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
by: Tran, Hung, et al.
Published: (2026)
by: Tran, Hung, et al.
Published: (2026)
daVinci-Dev: Agent-native Mid-training for Software Engineering
by: Zeng, Ji, et al.
Published: (2026)
by: Zeng, Ji, et al.
Published: (2026)
LMVC: An End-to-End Learned Multiview Video Coding Framework
by: Sheng, Xihua, et al.
Published: (2025)
by: Sheng, Xihua, et al.
Published: (2025)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
by: Guo, JunJia, et al.
Published: (2026)
by: Guo, JunJia, et al.
Published: (2026)
WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models
by: Li, Yangzhuo, et al.
Published: (2026)
by: Li, Yangzhuo, et al.
Published: (2026)
HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip
by: Tsai, Pei-Huan, et al.
Published: (2026)
by: Tsai, Pei-Huan, et al.
Published: (2026)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
by: Zheng, Yuxiang, et al.
Published: (2025)
by: Zheng, Yuxiang, et al.
Published: (2025)
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
by: Zhang, Linhao, et al.
Published: (2025)
by: Zhang, Linhao, et al.
Published: (2025)
Benchmarking AI Performance on End-to-End Data Science Projects
by: Hughes, Evelyn, et al.
Published: (2026)
by: Hughes, Evelyn, et al.
Published: (2026)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
by: Wu, Yunze, et al.
Published: (2025)
by: Wu, Yunze, et al.
Published: (2025)
SensorBench: Benchmarking LLMs in Coding-Based Sensor Processing
by: Quan, Pengrui, et al.
Published: (2024)
by: Quan, Pengrui, et al.
Published: (2024)
OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization
by: Zhu, Feng, et al.
Published: (2026)
by: Zhu, Feng, et al.
Published: (2026)
MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
by: Fakorede, Moshood A., et al.
Published: (2026)
by: Fakorede, Moshood A., et al.
Published: (2026)
WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
by: Yen, Thomson, et al.
Published: (2026)
by: Yen, Thomson, et al.
Published: (2026)
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
by: Kozlova, Anna, et al.
Published: (2026)
by: Kozlova, Anna, et al.
Published: (2026)
WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing
by: Kong, Fanheng, et al.
Published: (2026)
by: Kong, Fanheng, et al.
Published: (2026)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
by: Lin, Weihuang, et al.
Published: (2025)
by: Lin, Weihuang, et al.
Published: (2025)
BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
by: Lau, Elaine, et al.
Published: (2026)
by: Lau, Elaine, et al.
Published: (2026)
Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation
by: Khan, M Zafir Sadik, et al.
Published: (2026)
by: Khan, M Zafir Sadik, et al.
Published: (2026)
AI2Agent: An End-to-End Framework for Deploying AI Projects as Autonomous Agents
by: Chen, Jiaxiang, et al.
Published: (2025)
by: Chen, Jiaxiang, et al.
Published: (2025)
AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models
by: Zhang, Wentao, et al.
Published: (2026)
by: Zhang, Wentao, et al.
Published: (2026)
ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections
by: Contreras, Kebin, et al.
Published: (2026)
by: Contreras, Kebin, et al.
Published: (2026)
SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies
by: Saxena, Siddhant, et al.
Published: (2026)
by: Saxena, Siddhant, et al.
Published: (2026)
HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation
by: Yang, Hongyang, et al.
Published: (2026)
by: Yang, Hongyang, et al.
Published: (2026)
E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models
by: Cong, Wenyan, et al.
Published: (2025)
by: Cong, Wenyan, et al.
Published: (2025)
Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
by: Jia, Xiaosong, et al.
Published: (2024)
by: Jia, Xiaosong, et al.
Published: (2024)
DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle
by: Tang, Yuheng, et al.
Published: (2026)
by: Tang, Yuheng, et al.
Published: (2026)
FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
by: Zhu, Hongda, et al.
Published: (2025)
by: Zhu, Hongda, et al.
Published: (2025)
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
by: Chen, Haolin, et al.
Published: (2026)
by: Chen, Haolin, et al.
Published: (2026)
Deep-JGAC: End-to-End Deep Joint Geometry and Attribute Compression for Dense Colored Point Clouds
by: Zhang, Yun, et al.
Published: (2025)
by: Zhang, Yun, et al.
Published: (2025)
Recent Advances of End-to-End Video Coding Technologies for AVS Standard Development
by: Sheng, Xihua, et al.
Published: (2026)
by: Sheng, Xihua, et al.
Published: (2026)
Similar Items
-
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
by: Xu, Tianze, et al.
Published: (2025) -
Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
by: Zeng, Zhengran, et al.
Published: (2025) -
CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects
by: Guo, Hanyang, et al.
Published: (2025) -
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
by: Liu, Junwei, et al.
Published: (2025) -
Multiscale Feature Importance-based Bit Allocation for End-to-End Feature Coding for Machines
by: Liu, Junle, et al.
Published: (2025)