EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jia, Li, Ge, Zhang, Xuanming, Dong, Yihong, Jin, Zhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
di: Duston, Titouan, et al.
Pubblicazione: (2025)
di: Duston, Titouan, et al.
Pubblicazione: (2025)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
di: Wang, Yanli, et al.
Pubblicazione: (2024)
di: Wang, Yanli, et al.
Pubblicazione: (2024)
Rethinking Repetition Problems of LLMs in Code Generation
di: Dong, Yihong, et al.
Pubblicazione: (2025)
di: Dong, Yihong, et al.
Pubblicazione: (2025)
Exploring Data-Efficient Adaptation of Large Language Models for Code Generation
di: Jiang, Xue, et al.
Pubblicazione: (2024)
di: Jiang, Xue, et al.
Pubblicazione: (2024)
DevEval: Evaluating Code Generation in Practical Software Projects
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
di: Yang, Jie, et al.
Pubblicazione: (2026)
di: Yang, Jie, et al.
Pubblicazione: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
di: Jiang, Xue, et al.
Pubblicazione: (2025)
di: Jiang, Xue, et al.
Pubblicazione: (2025)
A Survey on Code Generation with LLM-based Agents
di: Dong, Yihong, et al.
Pubblicazione: (2025)
di: Dong, Yihong, et al.
Pubblicazione: (2025)
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2024)
CodeS: Natural Language to Code Repository via Multi-Layer Sketch
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation
di: Chen, Haorui, et al.
Pubblicazione: (2025)
di: Chen, Haorui, et al.
Pubblicazione: (2025)
MEMCoder: Multi-dimensional Evolving Memory for Private-Library-Oriented Code Generation
di: Li, Mofei, et al.
Pubblicazione: (2026)
di: Li, Mofei, et al.
Pubblicazione: (2026)
From I/O to Code with Discovery Agent
di: Dong, Yihong, et al.
Pubblicazione: (2026)
di: Dong, Yihong, et al.
Pubblicazione: (2026)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
di: Wang, Peiding, et al.
Pubblicazione: (2025)
di: Wang, Peiding, et al.
Pubblicazione: (2025)
UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian
di: Syromiatnikov, Mykyta, et al.
Pubblicazione: (2025)
di: Syromiatnikov, Mykyta, et al.
Pubblicazione: (2025)
CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
di: Han, Hojae, et al.
Pubblicazione: (2025)
di: Han, Hojae, et al.
Pubblicazione: (2025)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
di: Jiang, Nan, et al.
Pubblicazione: (2024)
di: Jiang, Nan, et al.
Pubblicazione: (2024)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
di: Zheng, Dewu, et al.
Pubblicazione: (2024)
di: Zheng, Dewu, et al.
Pubblicazione: (2024)
RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation
di: Liang, Linxi, et al.
Pubblicazione: (2025)
di: Liang, Linxi, et al.
Pubblicazione: (2025)
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
di: Pereira, Kristen, et al.
Pubblicazione: (2026)
di: Pereira, Kristen, et al.
Pubblicazione: (2026)
IndustryCode: A Benchmark for Industry Code Generation
di: Zeng, Puyu, et al.
Pubblicazione: (2026)
di: Zeng, Puyu, et al.
Pubblicazione: (2026)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
di: Ouyang, Siru, et al.
Pubblicazione: (2024)
IntentCoding: Amplifying User Intent in Code Generation
di: Fang, Zheng, et al.
Pubblicazione: (2026)
di: Fang, Zheng, et al.
Pubblicazione: (2026)
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
di: Zhang, Kechi, et al.
Pubblicazione: (2024)
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases
di: Liu, Xiangyan, et al.
Pubblicazione: (2024)
di: Liu, Xiangyan, et al.
Pubblicazione: (2024)
Automated Benchmark Generation for Repository-Level Coding Tasks
di: Vergopoulos, Konstantinos, et al.
Pubblicazione: (2025)
di: Vergopoulos, Konstantinos, et al.
Pubblicazione: (2025)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
di: Cai, Songcheng, et al.
Pubblicazione: (2026)
di: Cai, Songcheng, et al.
Pubblicazione: (2026)
AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context
di: Zhang, Lei, et al.
Pubblicazione: (2026)
di: Zhang, Lei, et al.
Pubblicazione: (2026)
OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement
di: Zheng, Tianyu, et al.
Pubblicazione: (2024)
di: Zheng, Tianyu, et al.
Pubblicazione: (2024)
A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code
di: Lian, Keke, et al.
Pubblicazione: (2025)
di: Lian, Keke, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
di: Li, Jia, et al.
Pubblicazione: (2024) -
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
di: Zhang, Wentao, et al.
Pubblicazione: (2026) -
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024) -
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
di: Duston, Titouan, et al.
Pubblicazione: (2025) -
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
di: Wang, Yanli, et al.
Pubblicazione: (2024)