ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Jie, Guo, Honglin, Ji, Li, Zhou, Jiazheng, Zheng, Rui, Lei, Zhikai, Zhang, Shuo, Xi, Zhiheng, Liu, Shichun, Wang, Yuxin, Wang, Bo, Zheng, Yining, Gui, Tao, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
par: Wang, Yubang, et autres
Publié: (2026)
par: Wang, Yubang, et autres
Publié: (2026)
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
par: Ding, Deming, et autres
Publié: (2026)
par: Ding, Deming, et autres
Publié: (2026)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
par: Fang, Shicheng, et autres
Publié: (2026)
par: Fang, Shicheng, et autres
Publié: (2026)
Multi-hop Reasoning via Early Knowledge Alignment
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
par: Li, Bowen, et autres
Publié: (2026)
par: Li, Bowen, et autres
Publié: (2026)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
par: Zheng, Jingnan, et autres
Publié: (2026)
par: Zheng, Jingnan, et autres
Publié: (2026)
VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
par: Yang, Jie, et autres
Publié: (2025)
par: Yang, Jie, et autres
Publié: (2025)
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
par: Wang, Yanli, et autres
Publié: (2024)
par: Wang, Yanli, et autres
Publié: (2024)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation
par: Zheng, Yan, et autres
Publié: (2026)
par: Zheng, Yan, et autres
Publié: (2026)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
par: Zhou, Qixing, et autres
Publié: (2026)
par: Zhou, Qixing, et autres
Publié: (2026)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
par: Wang, Weiyi, et autres
Publié: (2026)
par: Wang, Weiyi, et autres
Publié: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
The Open-World Lottery Ticket Hypothesis for OOD Intent Classification
par: Zhou, Yunhua, et autres
Publié: (2022)
par: Zhou, Yunhua, et autres
Publié: (2022)
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
par: He, Hang, et autres
Publié: (2025)
par: He, Hang, et autres
Publié: (2025)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
par: Zhang, Qiaohong, et autres
Publié: (2026)
par: Zhang, Qiaohong, et autres
Publié: (2026)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
par: Jin, Pengwei, et autres
Publié: (2025)
par: Jin, Pengwei, et autres
Publié: (2025)
Better Process Supervision with Bi-directional Rewarding Signals
par: Chen, Wenxiang, et autres
Publié: (2025)
par: Chen, Wenxiang, et autres
Publié: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering
par: Wang, Yuxin, et autres
Publié: (2026)
par: Wang, Yuxin, et autres
Publié: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026)
par: Song, Zhiheng, et autres
Publié: (2026)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories
par: Wang, Yanlin, et autres
Publié: (2026)
par: Wang, Yanlin, et autres
Publié: (2026)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
CritiQ: Mining Data Quality Criteria from Human Preferences
par: Guo, Honglin, et autres
Publié: (2025)
par: Guo, Honglin, et autres
Publié: (2025)
3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code
par: Gao, Yipeng, et autres
Publié: (2026)
par: Gao, Yipeng, et autres
Publié: (2026)
SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories
par: Shen, Chihao, et autres
Publié: (2025)
par: Shen, Chihao, et autres
Publié: (2025)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
Agentic Harness for Real-World Compilers
par: Zheng, Yingwei, et autres
Publié: (2026)
par: Zheng, Yingwei, et autres
Publié: (2026)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
par: Lv, Kai, et autres
Publié: (2025)
par: Lv, Kai, et autres
Publié: (2025)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
Documents similaires
-
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
par: Wang, Yubang, et autres
Publié: (2026) -
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
par: Ding, Deming, et autres
Publié: (2026) -
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
par: Fang, Shicheng, et autres
Publié: (2026) -
Multi-hop Reasoning via Early Knowledge Alignment
par: Wang, Yuxin, et autres
Publié: (2025) -
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
par: Li, Bowen, et autres
Publié: (2026)