CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Ruida, Peng, Chao, Ren, Jingyi, Jiang, Bo, Meng, Xiangxin, Wu, Qinyun, Gao, Pengfei, Wang, Xinchen, Gao, Cuiyun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models
par: Hu, Ruida, et autres
Publié: (2024)
par: Hu, Ruida, et autres
Publié: (2024)
Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development
par: Wang, Xinchen, et autres
Publié: (2026)
par: Wang, Xinchen, et autres
Publié: (2026)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
par: Wang, Xinchen, et autres
Publié: (2025)
par: Wang, Xinchen, et autres
Publié: (2025)
AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions
par: Wang, Xinchen, et autres
Publié: (2024)
par: Wang, Xinchen, et autres
Publié: (2024)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
par: Wu, Qinyun, et autres
Publié: (2024)
par: Wu, Qinyun, et autres
Publié: (2024)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
par: Hu, Ruida, et autres
Publié: (2026)
par: Hu, Ruida, et autres
Publié: (2026)
ReposVul: A Repository-Level High-Quality Vulnerability Dataset
par: Wang, Xinchen, et autres
Publié: (2024)
par: Wang, Xinchen, et autres
Publié: (2024)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling
par: Trae Research Team, et autres
Publié: (2025)
par: Trae Research Team, et autres
Publié: (2025)
CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering
par: Chen, Jialiang, et autres
Publié: (2025)
par: Chen, Jialiang, et autres
Publié: (2025)
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
par: Zhan, Zexun, et autres
Publié: (2025)
par: Zhan, Zexun, et autres
Publié: (2025)
VulEval: Towards Repository-Level Evaluation of Software Vulnerability Detection
par: Wen, Xin-Cheng, et autres
Publié: (2024)
par: Wen, Xin-Cheng, et autres
Publié: (2024)
DialogAgent: An Auto-engagement Agent for Code Question Answering Data Production
par: Liang, Xiaoyun, et autres
Publié: (2024)
par: Liang, Xiaoyun, et autres
Publié: (2024)
An Empirical Study on LLM-based Agents for Automated Bug Fixing
par: Meng, Xiangxin, et autres
Publié: (2024)
par: Meng, Xiangxin, et autres
Publié: (2024)
The Current Challenges of Software Engineering in the Era of Large Language Models
par: Gao, Cuiyun, et autres
Publié: (2024)
par: Gao, Cuiyun, et autres
Publié: (2024)
Tool-integrated Reinforcement Learning for Repo Deep Search
par: Ma, Zexiong, et autres
Publié: (2025)
par: Ma, Zexiong, et autres
Publié: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
par: Feng, Jia, et autres
Publié: (2024)
par: Feng, Jia, et autres
Publié: (2024)
AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration
par: Wang, Ruiqi, et autres
Publié: (2025)
par: Wang, Ruiqi, et autres
Publié: (2025)
RepoQA: Evaluating Long Context Code Understanding
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
On the Replicability and Reproducibility of Deep Learning in Software Engineering
par: Liu, Chao, et autres
Publié: (2020)
par: Liu, Chao, et autres
Publié: (2020)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
par: Ouyang, Siru, et autres
Publié: (2024)
par: Ouyang, Siru, et autres
Publié: (2024)
Game Rewards Vulnerabilities: Software Vulnerability Detection with Zero-Sum Game and Prototype Learning
par: Wen, Xin-Cheng, et autres
Publié: (2024)
par: Wen, Xin-Cheng, et autres
Publié: (2024)
Less is More? An Empirical Study on Configuration Issues in Python PyPI Ecosystem
par: Peng, Yun, et autres
Publié: (2023)
par: Peng, Yun, et autres
Publié: (2023)
RustRepoTrans: Repository-level Code Translation Benchmark Targeting Rust
par: Ou, Guangsheng, et autres
Publié: (2024)
par: Ou, Guangsheng, et autres
Publié: (2024)
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning
par: Ma, Zexiong, et autres
Publié: (2025)
par: Ma, Zexiong, et autres
Publié: (2025)
More with Less: An Empirical Study of Turn-Control Strategies for Efficient Coding Agents
par: Gao, Pengfei, et autres
Publié: (2025)
par: Gao, Pengfei, et autres
Publié: (2025)
MarsCode Agent: AI-native Automated Bug Fixing
par: Liu, Yizhou, et autres
Publié: (2024)
par: Liu, Yizhou, et autres
Publié: (2024)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
RepoTransAgent: Multi-Agent LLM Framework for Repository-Aware Code Translation
par: Guan, Ziqi, et autres
Publié: (2025)
par: Guan, Ziqi, et autres
Publié: (2025)
SEER: Enhancing Chain-of-Thought Code Generation through Self-Exploring Deep Reasoning
par: Gao, Shuzheng, et autres
Publié: (2025)
par: Gao, Shuzheng, et autres
Publié: (2025)
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
par: Wang, Chaozheng, et autres
Publié: (2024)
par: Wang, Chaozheng, et autres
Publié: (2024)
Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing
par: Wang, Chaozheng, et autres
Publié: (2026)
par: Wang, Chaozheng, et autres
Publié: (2026)
Empirical Study of Code Large Language Models for Binary Security Patch Detection
par: Li, Qingyuan, et autres
Publié: (2025)
par: Li, Qingyuan, et autres
Publié: (2025)
Search-Based LLMs for Code Optimization
par: Gao, Shuzheng, et autres
Publié: (2024)
par: Gao, Shuzheng, et autres
Publié: (2024)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
par: Wang, Chaozheng, et autres
Publié: (2024)
par: Wang, Chaozheng, et autres
Publié: (2024)
Testing Question Answering Software with Context-Driven Question Generation
par: Liu, Shuang, et autres
Publié: (2025)
par: Liu, Shuang, et autres
Publié: (2025)
RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
par: Qu, Wenjie, et autres
Publié: (2025)
par: Qu, Wenjie, et autres
Publié: (2025)
RepoST: Scalable Repository-Level Coding Environment Construction with Sandbox Testing
par: Xie, Yiqing, et autres
Publié: (2025)
par: Xie, Yiqing, et autres
Publié: (2025)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
par: Wang, Ruiqi, et autres
Publié: (2025)
par: Wang, Ruiqi, et autres
Publié: (2025)
Documents similaires
-
A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models
par: Hu, Ruida, et autres
Publié: (2024) -
Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development
par: Wang, Xinchen, et autres
Publié: (2026) -
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
par: Hu, Ruida, et autres
Publié: (2025) -
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
par: Wang, Xinchen, et autres
Publié: (2025) -
AEGIS: An Agent-based Framework for General Bug Reproduction from Issue Descriptions
par: Wang, Xinchen, et autres
Publié: (2024)