RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jia, Deng, Hongyi, Zhang, Yiran, Zhang, Kechi, Shao, Tianqi, Zhao, Tiankuo, Wang, Weinan, Jin, Zhi, Li, Ge, Liu, Yang, Fang, Yingtao, Dong, Yihong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
por: Jin, Pengwei, et al.
Publicado: (2025)
por: Jin, Pengwei, et al.
Publicado: (2025)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
por: Wang, Yanli, et al.
Publicado: (2024)
por: Wang, Yanli, et al.
Publicado: (2024)
GraphCodeAgent: Dual Graph-Guided LLM Agent for Retrieval-Augmented Repo-Level Code Generation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
por: Shen, Chihao, et al.
Publicado: (2025)
por: Shen, Chihao, et al.
Publicado: (2025)
A Viable Paradigm of Software Automation: Iterative End-to-End Automated Software Development
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
RealBench: Benchmarking Data-Driven Numerical Weather Forecasting Under Operational Conditions and Extreme Event Challenges
por: Li, Ruize, et al.
Publicado: (2026)
por: Li, Ruize, et al.
Publicado: (2026)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
RepoScope: Leveraging Call Chain-Aware Multi-View Context for Repository-Level Code Generation
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
HiRoPE: Length Extrapolation for Code Models Using Hierarchical Position
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
por: Wu, Qinyun, et al.
Publicado: (2024)
por: Wu, Qinyun, et al.
Publicado: (2024)
A Survey on Code Generation with LLM-based Agents
por: Dong, Yihong, et al.
Publicado: (2025)
por: Dong, Yihong, et al.
Publicado: (2025)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
por: Yang, Jie, et al.
Publicado: (2026)
por: Yang, Jie, et al.
Publicado: (2026)
CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent System
por: Hu, Li, et al.
Publicado: (2025)
por: Hu, Li, et al.
Publicado: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026)
por: Shi, Yuzhen, et al.
Publicado: (2026)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
SEAlign: Alignment Training for Software Engineering Agent
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing
por: Li, Xuefeng, et al.
Publicado: (2026)
por: Li, Xuefeng, et al.
Publicado: (2026)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
por: Zhang, Zehua, et al.
Publicado: (2025)
por: Zhang, Zehua, et al.
Publicado: (2025)
StackTrans: From Large Language Model to Large Pushdown Automata Model
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
Neurosymbolic Repo-level Code Localization
por: Xu, Xiufeng, et al.
Publicado: (2026)
por: Xu, Xiufeng, et al.
Publicado: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
por: Zhang, Qiaohong, et al.
Publicado: (2026)
por: Zhang, Qiaohong, et al.
Publicado: (2026)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
por: Zhao, Songwen, et al.
Publicado: (2025)
por: Zhao, Songwen, et al.
Publicado: (2025)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
por: Liu, Huanyu, et al.
Publicado: (2025)
por: Liu, Huanyu, et al.
Publicado: (2025)
Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
por: Xiong, Qian, et al.
Publicado: (2025)
por: Xiong, Qian, et al.
Publicado: (2025)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
por: Hu, Ruida, et al.
Publicado: (2024)
por: Hu, Ruida, et al.
Publicado: (2024)
An Empirical Study of Proactive Coding Assistants in Real-World Software Development
por: Li, Lehui, et al.
Publicado: (2026)
por: Li, Lehui, et al.
Publicado: (2026)
LONGCODEU: Benchmarking Long-Context Language Models on Long Code Understanding
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
por: Ding, Jingzhe, et al.
Publicado: (2025)
por: Ding, Jingzhe, et al.
Publicado: (2025)
aiXcoder-7B-v2: Training LLMs to Fully Utilize the Long Context in Repository-level Code Completion
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
por: Ouyang, Siru, et al.
Publicado: (2024)
por: Ouyang, Siru, et al.
Publicado: (2024)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
por: Gao, Zeyu, et al.
Publicado: (2025)
por: Gao, Zeyu, et al.
Publicado: (2025)
Ejemplares similares
-
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024) -
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
por: Zhang, Kechi, et al.
Publicado: (2024) -
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
por: Jin, Pengwei, et al.
Publicado: (2025) -
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
por: Wang, Yanli, et al.
Publicado: (2024) -
GraphCodeAgent: Dual Graph-Guided LLM Agent for Retrieval-Augmented Repo-Level Code Generation
por: Li, Jia, et al.
Publicado: (2025)