Scalable Supervising Software Agents with Patch Reasoner
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Junjielong, Tan, Boyin, Liu, Xiaoyuan, Peng, Chao, Gao, Pengfei, He, Pinjia |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AL-Bench: A Benchmark for Automatic Logging
by: Tan, Boyin, et al.
Published: (2025)
by: Tan, Boyin, et al.
Published: (2025)
Aligning the Objective of LLM-based Program Repair
by: Xu, Junjielong, et al.
Published: (2024)
by: Xu, Junjielong, et al.
Published: (2024)
SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
by: Tan, Boyin, et al.
Published: (2026)
by: Tan, Boyin, et al.
Published: (2026)
BackportBench: A Multilingual Benchmark for Automated Backporting of Patches
by: Zhong, Zhiqing, et al.
Published: (2025)
by: Zhong, Zhiqing, et al.
Published: (2025)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
by: Hu, Ruida, et al.
Published: (2025)
by: Hu, Ruida, et al.
Published: (2025)
Prompting for Automatic Log Template Extraction
by: Xu, Junjielong, et al.
Published: (2023)
by: Xu, Junjielong, et al.
Published: (2023)
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
by: Yu, Boxi, et al.
Published: (2025)
by: Yu, Boxi, et al.
Published: (2025)
CodeScout: Contextual Problem Statement Enhancement for Software Agents
by: Suri, Manan, et al.
Published: (2026)
by: Suri, Manan, et al.
Published: (2026)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
by: Wang, Xinchen, et al.
Published: (2025)
by: Wang, Xinchen, et al.
Published: (2025)
A Goal-Driven Survey on Root Cause Analysis
by: Fang, Aoyang, et al.
Published: (2025)
by: Fang, Aoyang, et al.
Published: (2025)
RepoST: Scalable Repository-Level Coding Environment Construction with Sandbox Testing
by: Xie, Yiqing, et al.
Published: (2025)
by: Xie, Yiqing, et al.
Published: (2025)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
by: Xie, Yiqing, et al.
Published: (2024)
by: Xie, Yiqing, et al.
Published: (2024)
SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue Resolving
by: Tao, Chaofan, et al.
Published: (2026)
by: Tao, Chaofan, et al.
Published: (2026)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
by: Sun, Shuang, et al.
Published: (2026)
by: Sun, Shuang, et al.
Published: (2026)
PatchRecall: Patch-Driven Retrieval for Automated Program Repair
by: Dihan, Mahir Labib, et al.
Published: (2026)
by: Dihan, Mahir Labib, et al.
Published: (2026)
Training Software Engineering Agents and Verifiers with SWE-Gym
by: Pan, Jiayi, et al.
Published: (2024)
by: Pan, Jiayi, et al.
Published: (2024)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
by: Deng, Xiang, et al.
Published: (2025)
by: Deng, Xiang, et al.
Published: (2025)
ChatDev: Communicative Agents for Software Development
by: Qian, Chen, et al.
Published: (2023)
by: Qian, Chen, et al.
Published: (2023)
Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
by: Zainullina, Karina, et al.
Published: (2025)
by: Zainullina, Karina, et al.
Published: (2025)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
by: Song, Huatong, et al.
Published: (2026)
by: Song, Huatong, et al.
Published: (2026)
Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study
by: Li, Bowen, et al.
Published: (2024)
by: Li, Bowen, et al.
Published: (2024)
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning
by: Ma, Zexiong, et al.
Published: (2025)
by: Ma, Zexiong, et al.
Published: (2025)
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
by: Badertdinov, Ibragim, et al.
Published: (2025)
by: Badertdinov, Ibragim, et al.
Published: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
by: Liu, Kaiyuan, et al.
Published: (2025)
by: Liu, Kaiyuan, et al.
Published: (2025)
MicLog: Towards Accurate and Efficient LLM-based Log Parsing via Progressive Meta In-Context Learning
by: Yu, Jianbo, et al.
Published: (2026)
by: Yu, Jianbo, et al.
Published: (2026)
Software Engineering Methods For AI-Driven Deductive Legal Reasoning
by: Padhye, Rohan
Published: (2024)
by: Padhye, Rohan
Published: (2024)
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
by: Weyssow, Martin, et al.
Published: (2025)
by: Weyssow, Martin, et al.
Published: (2025)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
by: Wan, Yuxuan, et al.
Published: (2024)
by: Wan, Yuxuan, et al.
Published: (2024)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
by: Ludwig, Nikolai, et al.
Published: (2026)
by: Ludwig, Nikolai, et al.
Published: (2026)
OpenHands: An Open Platform for AI Software Developers as Generalist Agents
by: Wang, Xingyao, et al.
Published: (2024)
by: Wang, Xingyao, et al.
Published: (2024)
Agents in Software Engineering: Survey, Landscape, and Vision
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents
by: Ma, Murong, et al.
Published: (2026)
by: Ma, Murong, et al.
Published: (2026)
From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration
by: Xu, Haoyuan, et al.
Published: (2026)
by: Xu, Haoyuan, et al.
Published: (2026)
SWE-smith: Scaling Data for Software Engineering Agents
by: Yang, John, et al.
Published: (2025)
by: Yang, John, et al.
Published: (2025)
Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
by: Chen, Zejian, et al.
Published: (2026)
by: Chen, Zejian, et al.
Published: (2026)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
by: Du, Yaxin, et al.
Published: (2025)
by: Du, Yaxin, et al.
Published: (2025)
Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark
by: Fang, Aoyang, et al.
Published: (2025)
by: Fang, Aoyang, et al.
Published: (2025)
Dont Stop Early: Scalable Enterprise Deep Research with Controlled Information Flow and Evidence-Aware Termination
by: Choubey, Prafulla Kumar, et al.
Published: (2026)
by: Choubey, Prafulla Kumar, et al.
Published: (2026)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
by: Sonwane, Atharv, et al.
Published: (2026)
by: Sonwane, Atharv, et al.
Published: (2026)
Similar Items
-
AL-Bench: A Benchmark for Automatic Logging
by: Tan, Boyin, et al.
Published: (2025) -
Aligning the Objective of LLM-based Program Repair
by: Xu, Junjielong, et al.
Published: (2024) -
SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
by: Tan, Boyin, et al.
Published: (2026) -
BackportBench: A Multilingual Benchmark for Automated Backporting of Patches
by: Zhong, Zhiqing, et al.
Published: (2025) -
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
by: Hu, Ruida, et al.
Published: (2025)