ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jia, Zhuang, Zeyang, Chen, Zhuangbin, Su, Yuxin, Meng, Wei, Lyu, Michael R. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VulKey: Automated Vulnerability Repair Guided by Domain-Specific Repair Patterns
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
MTAD: Tools and Benchmarks for Multivariate Time Series Anomaly Detection
by: Liu, Jinyang, et al.
Published: (2024)
by: Liu, Jinyang, et al.
Published: (2024)
CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent System
by: Hu, Li, et al.
Published: (2025)
by: Hu, Li, et al.
Published: (2025)
TraceMesh: Scalable and Streaming Sampling for Distributed Traces
by: Chen, Zhuangbin, et al.
Published: (2024)
by: Chen, Zhuangbin, et al.
Published: (2024)
LUNAR: Unsupervised LLM-based Log Parsing
by: Huang, Junjie, et al.
Published: (2024)
by: Huang, Junjie, et al.
Published: (2024)
RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing
by: Li, Xuefeng, et al.
Published: (2026)
by: Li, Xuefeng, et al.
Published: (2026)
RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation
by: Wang, Yanli, et al.
Published: (2024)
by: Wang, Yanli, et al.
Published: (2024)
RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust
by: Ou, Guangsheng, et al.
Published: (2024)
by: Ou, Guangsheng, et al.
Published: (2024)
Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits
by: Zhu, Haichao, et al.
Published: (2026)
by: Zhu, Haichao, et al.
Published: (2026)
RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
by: Peng, Zhiyuan, et al.
Published: (2026)
by: Peng, Zhiyuan, et al.
Published: (2026)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
by: Zhang, Kechi, et al.
Published: (2024)
by: Zhang, Kechi, et al.
Published: (2024)
MioHint: LLM-assisted Mutation for Whitebox API Testing
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
PhantomRun: Auto Repair of Compilation Errors in Embedded Open Source Software
by: Fu, Han, et al.
Published: (2026)
by: Fu, Han, et al.
Published: (2026)
RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair
by: Pan, Zhongqiang, et al.
Published: (2026)
by: Pan, Zhongqiang, et al.
Published: (2026)
ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents
by: Shen, Haiyang, et al.
Published: (2024)
by: Shen, Haiyang, et al.
Published: (2024)
Variability-Aware Detection and Repair of Compilation Errors Using Foundation Models in Configurable Systems
by: Gheyi, Rohit, et al.
Published: (2026)
by: Gheyi, Rohit, et al.
Published: (2026)
Tracezip: Efficient Distributed Tracing via Trace Compression
by: Chen, Zhuangbin, et al.
Published: (2025)
by: Chen, Zhuangbin, et al.
Published: (2025)
TypeScript Repository Indexing for Code Agent Retrieval
by: Pu, Junsong, et al.
Published: (2026)
by: Pu, Junsong, et al.
Published: (2026)
MicroRacer: Detecting Concurrency Bugs for Cloud Service Systems
by: Deng, Zhiling, et al.
Published: (2025)
by: Deng, Zhiling, et al.
Published: (2025)
COCA: Generative Root Cause Analysis for Distributed Systems with Code Knowledge
by: Li, Yichen, et al.
Published: (2025)
by: Li, Yichen, et al.
Published: (2025)
Neurosymbolic Repo-level Code Localization
by: Xu, Xiufeng, et al.
Published: (2026)
by: Xu, Xiufeng, et al.
Published: (2026)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
by: Martinez, Matias, et al.
Published: (2026)
by: Martinez, Matias, et al.
Published: (2026)
ColorGo: Directed Concolic Execution
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software
by: Zhang, Zehua, et al.
Published: (2025)
by: Zhang, Zehua, et al.
Published: (2025)
ComPass: Contrastive Learning for Automated Patch Correctness Assessment in Program Repair
by: Zhang, Quanjun, et al.
Published: (2026)
by: Zhang, Quanjun, et al.
Published: (2026)
WARP -- Web-Augmented Real-time Program Repairer: A Real-Time Compilation Error Resolution using LLMs and Web-Augmented Synthesis
by: Luiz, Anderson de Lima
Published: (2025)
by: Luiz, Anderson de Lima
Published: (2025)
Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems
by: Wang, Yilun, et al.
Published: (2026)
by: Wang, Yilun, et al.
Published: (2026)
An Empirical Study of Interaction Bugs in ROS-based Software
by: Chen, Zhixiang, et al.
Published: (2025)
by: Chen, Zhixiang, et al.
Published: (2025)
Identifying Performance Issues in Cloud Service Systems Based on Relational-Temporal Features
by: Gu, Wenwei, et al.
Published: (2023)
by: Gu, Wenwei, et al.
Published: (2023)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
by: Hu, Ruida, et al.
Published: (2024)
by: Hu, Ruida, et al.
Published: (2024)
CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows
by: Muna, Rabeya Khatun, et al.
Published: (2026)
by: Muna, Rabeya Khatun, et al.
Published: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
by: Gao, Zeyu, et al.
Published: (2025)
by: Gao, Zeyu, et al.
Published: (2025)
MASPrism: Lightweight Failure Attribution for Multi-Agent Systems Using Prefill-Stage Signals
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
LogPrism: Unifying Structure and Variable Encoding for Effective Log Compression
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
OFP-Repair: Repairing Floating-point Errors via Original-Precision Arithmetic
by: Tan, Youshuai, et al.
Published: (2025)
by: Tan, Youshuai, et al.
Published: (2025)
RepoScope: Leveraging Call Chain-Aware Multi-View Context for Repository-Level Code Generation
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
PyTy: Repairing Static Type Errors in Python
by: Chow, Yiu Wai, et al.
Published: (2024)
by: Chow, Yiu Wai, et al.
Published: (2024)
A Large-Scale Evaluation for Log Parsing Techniques: How Far Are We?
by: Jiang, Zhihan, et al.
Published: (2023)
by: Jiang, Zhihan, et al.
Published: (2023)
Similar Items
-
VulKey: Automated Vulnerability Repair Guided by Domain-Specific Repair Patterns
by: Li, Jia, et al.
Published: (2026) -
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
by: Li, Jia, et al.
Published: (2026) -
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
by: Li, Jia, et al.
Published: (2026) -
MTAD: Tools and Benchmarks for Multivariate Time Series Anomaly Detection
by: Liu, Jinyang, et al.
Published: (2024) -
CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent System
by: Hu, Li, et al.
Published: (2025)