E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jingyao, Huang, Chen, Guan, Zhizhao, Lei, Wenqiang, Deng, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
por: Lu, Pengrui, et al.
Publicado: (2026)
por: Lu, Pengrui, et al.
Publicado: (2026)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
por: Adamenko, Pavel, et al.
Publicado: (2025)
por: Adamenko, Pavel, et al.
Publicado: (2025)
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
por: Liu, Junwei, et al.
Publicado: (2025)
por: Liu, Junwei, et al.
Publicado: (2025)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
por: Tran, Hung, et al.
Publicado: (2026)
por: Tran, Hung, et al.
Publicado: (2026)
Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs
por: Le, Nguyen-Khang, et al.
Publicado: (2025)
por: Le, Nguyen-Khang, et al.
Publicado: (2025)
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
por: Wang, Kaixin, et al.
Publicado: (2025)
por: Wang, Kaixin, et al.
Publicado: (2025)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
por: Hu, Ruida, et al.
Publicado: (2026)
por: Hu, Ruida, et al.
Publicado: (2026)
FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
por: Zhu, Hongda, et al.
Publicado: (2025)
por: Zhu, Hongda, et al.
Publicado: (2025)
Large Language Models for In-File Vulnerability Localization Can Be "Lost in the End"
por: Sovrano, Francesco, et al.
Publicado: (2025)
por: Sovrano, Francesco, et al.
Publicado: (2025)
How Well Do Large Language Models Serve as End-to-End Secure Code Agents for Python?
por: Gong, Jianian, et al.
Publicado: (2024)
por: Gong, Jianian, et al.
Publicado: (2024)
Multilingual Multimodal Software Developer for Code Generation
por: Chai, Linzheng, et al.
Publicado: (2025)
por: Chai, Linzheng, et al.
Publicado: (2025)
Solving Data-centric Tasks using Large Language Models
por: Barke, Shraddha, et al.
Publicado: (2024)
por: Barke, Shraddha, et al.
Publicado: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing
por: Kong, Fanheng, et al.
Publicado: (2026)
por: Kong, Fanheng, et al.
Publicado: (2026)
A Layered Architecture for Developing and Enhancing Capabilities in Large Language Model-based Software Systems
por: Zhang, Dawen, et al.
Publicado: (2024)
por: Zhang, Dawen, et al.
Publicado: (2024)
ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models
por: Han, Hojae, et al.
Publicado: (2024)
por: Han, Hojae, et al.
Publicado: (2024)
Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling
por: Ni, Ziyi, et al.
Publicado: (2024)
por: Ni, Ziyi, et al.
Publicado: (2024)
A Code Comprehension Benchmark for Large Language Models for Code
por: Havare, Jayant, et al.
Publicado: (2025)
por: Havare, Jayant, et al.
Publicado: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
por: Sun, Ruoyu, et al.
Publicado: (2025)
por: Sun, Ruoyu, et al.
Publicado: (2025)
Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
por: Huang, Yuheng, et al.
Publicado: (2023)
por: Huang, Yuheng, et al.
Publicado: (2023)
KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?
por: Jiang, Xue, et al.
Publicado: (2026)
por: Jiang, Xue, et al.
Publicado: (2026)
Unifying the Perspectives of NLP and Software Engineering: A Survey on Language Models for Code
por: Zhang, Ziyin, et al.
Publicado: (2023)
por: Zhang, Ziyin, et al.
Publicado: (2023)
Beyond Postconditions: Can Large Language Models infer Formal Contracts for Automatic Software Verification?
por: Richter, Cedric, et al.
Publicado: (2025)
por: Richter, Cedric, et al.
Publicado: (2025)
SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents
por: Zhang, Zhirui, et al.
Publicado: (2026)
por: Zhang, Zhirui, et al.
Publicado: (2026)
A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks
por: Dandamudi, Rohit, et al.
Publicado: (2024)
por: Dandamudi, Rohit, et al.
Publicado: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2024)
por: Zheng, Jiasheng, et al.
Publicado: (2024)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
por: Sonwane, Atharv, et al.
Publicado: (2026)
por: Sonwane, Atharv, et al.
Publicado: (2026)
Efficient Detection of Toxic Prompts in Large Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation
por: Khan, M Zafir Sadik, et al.
Publicado: (2026)
por: Khan, M Zafir Sadik, et al.
Publicado: (2026)
Transducer Tuning: Efficient Model Adaptation for Software Tasks Using Code Property Graphs
por: Yusuf, Imam Nur Bani, et al.
Publicado: (2024)
por: Yusuf, Imam Nur Bani, et al.
Publicado: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
por: Cheng, Keyuan, et al.
Publicado: (2025)
por: Cheng, Keyuan, et al.
Publicado: (2025)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
por: Qiu, Jielin, et al.
Publicado: (2025)
por: Qiu, Jielin, et al.
Publicado: (2025)
Self-Explained Keywords Empower Large Language Models for Code Generation
por: Fan, Lishui, et al.
Publicado: (2024)
por: Fan, Lishui, et al.
Publicado: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
por: Yang, Jie, et al.
Publicado: (2026)
por: Yang, Jie, et al.
Publicado: (2026)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
por: Zhang, Zehua, et al.
Publicado: (2025)
por: Zhang, Zehua, et al.
Publicado: (2025)
Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
por: Huang, Baizhou, et al.
Publicado: (2023)
por: Huang, Baizhou, et al.
Publicado: (2023)
E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning
por: Zhang, Lingzhe, et al.
Publicado: (2026)
por: Zhang, Lingzhe, et al.
Publicado: (2026)
Advancing Language Models for Code-related Tasks
por: Tian, Zhao
Publicado: (2026)
por: Tian, Zhao
Publicado: (2026)
Iterative Experience Refinement of Software-Developing Agents
por: Qian, Chen, et al.
Publicado: (2024)
por: Qian, Chen, et al.
Publicado: (2024)
Ejemplares similares
-
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
por: Lu, Pengrui, et al.
Publicado: (2026) -
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
por: Adamenko, Pavel, et al.
Publicado: (2025) -
EvoDev: An Iterative Feature-Driven Framework for End-to-End Software Development with LLM-based Agents
por: Liu, Junwei, et al.
Publicado: (2025) -
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
por: Tran, Hung, et al.
Publicado: (2026) -
Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs
por: Le, Nguyen-Khang, et al.
Publicado: (2025)