SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Boyin, Deng, Haoning, Zhang, Junyuan, Xu, Junjielong, He, Pinjia, Sun, Youcheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AL-Bench: A Benchmark for Automatic Logging
by: Tan, Boyin, et al.
Published: (2025)
by: Tan, Boyin, et al.
Published: (2025)
Scalable Supervising Software Agents with Patch Reasoner
by: Xu, Junjielong, et al.
Published: (2025)
by: Xu, Junjielong, et al.
Published: (2025)
Prompting for Automatic Log Template Extraction
by: Xu, Junjielong, et al.
Published: (2023)
by: Xu, Junjielong, et al.
Published: (2023)
Aligning the Objective of LLM-based Program Repair
by: Xu, Junjielong, et al.
Published: (2024)
by: Xu, Junjielong, et al.
Published: (2024)
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
by: Yu, Boxi, et al.
Published: (2025)
by: Yu, Boxi, et al.
Published: (2025)
A Goal-Driven Survey on Root Cause Analysis
by: Fang, Aoyang, et al.
Published: (2025)
by: Fang, Aoyang, et al.
Published: (2025)
SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark
by: Yu, Boxi, et al.
Published: (2026)
by: Yu, Boxi, et al.
Published: (2026)
MicLog: Towards Accurate and Efficient LLM-based Log Parsing via Progressive Meta In-Context Learning
by: Yu, Jianbo, et al.
Published: (2026)
by: Yu, Jianbo, et al.
Published: (2026)
Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark
by: Fang, Aoyang, et al.
Published: (2025)
by: Fang, Aoyang, et al.
Published: (2025)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
by: Aleithan, Reem, et al.
Published: (2024)
by: Aleithan, Reem, et al.
Published: (2024)
SWE-Effi: Re-Evaluating Software AI Agent System Effectiveness Under Resource Constraints
by: Fan, Zhiyu, et al.
Published: (2025)
by: Fan, Zhiyu, et al.
Published: (2025)
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
by: Dihan, Mahir Labib, et al.
Published: (2026)
by: Dihan, Mahir Labib, et al.
Published: (2026)
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
by: Guan, Hao, et al.
Published: (2026)
by: Guan, Hao, et al.
Published: (2026)
SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
by: He, Xinyi, et al.
Published: (2025)
by: He, Xinyi, et al.
Published: (2025)
DeLog: An Efficient Log Compression Framework with Pattern Signature Synthesis
by: Yu, Siyu, et al.
Published: (2026)
by: Yu, Siyu, et al.
Published: (2026)
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
by: Wang, Yuhang, et al.
Published: (2026)
by: Wang, Yuhang, et al.
Published: (2026)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
by: Xu, Yisen, et al.
Published: (2026)
by: Xu, Yisen, et al.
Published: (2026)
Gleaner: A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics
by: Yang, Yifan, et al.
Published: (2026)
by: Yang, Yifan, et al.
Published: (2026)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
by: Raghavendra, Mohit, et al.
Published: (2026)
by: Raghavendra, Mohit, et al.
Published: (2026)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
UniSage: A Unified and Post-Analysis-Aware Sampling for Microservices
by: Zhu, Zhouruixing, et al.
Published: (2025)
by: Zhu, Zhouruixing, et al.
Published: (2025)
Unlocking the Power of Numbers: Log Compression via Numeric Token Parsing
by: Yu, Siyu, et al.
Published: (2024)
by: Yu, Siyu, et al.
Published: (2024)
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
by: Xu, Jingxuan, et al.
Published: (2025)
by: Xu, Jingxuan, et al.
Published: (2025)
Context Before Code: An Experience Report on Vibe Coding in Practice
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
SWE-QA: A Dataset and Benchmark for Complex Code Understanding
by: Elkoussy, Laïla, et al.
Published: (2026)
by: Elkoussy, Laïla, et al.
Published: (2026)
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
by: Han, Hao, et al.
Published: (2026)
by: Han, Hao, et al.
Published: (2026)
ReqInOne: A Large Language Model-Based Agent for Software Requirements Specification Generation
by: Zhu, Taohong, et al.
Published: (2025)
by: Zhu, Taohong, et al.
Published: (2025)
Towards Large Language Model Guided Kernel Direct Fuzzing
by: Li, Xie, et al.
Published: (2025)
by: Li, Xie, et al.
Published: (2025)
DynaCausal: Dynamic Causality-Aware Root Cause Analysis for Distributed Microservices
by: Zhang, Songhan, et al.
Published: (2025)
by: Zhang, Songhan, et al.
Published: (2025)
An Empirical Study on Package-Level Deprecation in Python Ecosystem
by: Zhong, Zhiqing, et al.
Published: (2024)
by: Zhong, Zhiqing, et al.
Published: (2024)
Reproduction Test Generation for Java SWE Issues
by: Ahmed, Toufique, et al.
Published: (2026)
by: Ahmed, Toufique, et al.
Published: (2026)
Agentic Model Checking
by: Sun, Youcheng, et al.
Published: (2026)
by: Sun, Youcheng, et al.
Published: (2026)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
by: Hu, Ruida, et al.
Published: (2025)
by: Hu, Ruida, et al.
Published: (2025)
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs
by: Pham, Minh V. T., et al.
Published: (2025)
by: Pham, Minh V. T., et al.
Published: (2025)
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
by: Badertdinov, Ibragim, et al.
Published: (2026)
by: Badertdinov, Ibragim, et al.
Published: (2026)
SWE-Bench-CL: Continual Learning for Coding Agents
by: Joshi, Thomas, et al.
Published: (2025)
by: Joshi, Thomas, et al.
Published: (2025)
SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback
by: Kumar, Deepak
Published: (2026)
by: Kumar, Deepak
Published: (2026)
SWE-bench Goes Live!
by: Zhang, Linghao, et al.
Published: (2025)
by: Zhang, Linghao, et al.
Published: (2025)
Similar Items
-
AL-Bench: A Benchmark for Automatic Logging
by: Tan, Boyin, et al.
Published: (2025) -
Scalable Supervising Software Agents with Patch Reasoner
by: Xu, Junjielong, et al.
Published: (2025) -
Prompting for Automatic Log Template Extraction
by: Xu, Junjielong, et al.
Published: (2023) -
Aligning the Objective of LLM-based Program Repair
by: Xu, Junjielong, et al.
Published: (2024) -
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
by: Yu, Boxi, et al.
Published: (2025)