Salvato in:
| Autori principali: | Ye, Wencheng, Liu, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2511.03517 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
di: Han, Hao, et al.
Pubblicazione: (2026)
di: Han, Hao, et al.
Pubblicazione: (2026)
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026)
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026)
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
GHIssuemarket: A Sandbox Environment for SWE-Agents Economic Experimentation
di: Fouad, Mohamed A., et al.
Pubblicazione: (2024)
di: Fouad, Mohamed A., et al.
Pubblicazione: (2024)
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
di: Guan, Hao, et al.
Pubblicazione: (2026)
di: Guan, Hao, et al.
Pubblicazione: (2026)
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
di: Prathifkumar, Thanosan, et al.
Pubblicazione: (2025)
di: Prathifkumar, Thanosan, et al.
Pubblicazione: (2025)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2026)
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2026)
Training Software Engineering Agents and Verifiers with SWE-Gym
di: Pan, Jiayi, et al.
Pubblicazione: (2024)
di: Pan, Jiayi, et al.
Pubblicazione: (2024)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
di: Raghavendra, Mohit, et al.
Pubblicazione: (2026)
di: Raghavendra, Mohit, et al.
Pubblicazione: (2026)
When Agents go Astray: Course-Correcting SWE Agents with PRMs
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
di: Sahoo, Priyam, et al.
Pubblicazione: (2026)
di: Sahoo, Priyam, et al.
Pubblicazione: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
TOM-SWE: User Mental Modeling For Software Engineering Agents
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
di: He, Xinyi, et al.
Pubblicazione: (2025)
di: He, Xinyi, et al.
Pubblicazione: (2025)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
di: Yang, Zonghan, et al.
Pubblicazione: (2025)
di: Yang, Zonghan, et al.
Pubblicazione: (2025)
Reproduction Test Generation for Java SWE Issues
di: Ahmed, Toufique, et al.
Pubblicazione: (2026)
di: Ahmed, Toufique, et al.
Pubblicazione: (2026)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study
di: Wang, You, et al.
Pubblicazione: (2025)
di: Wang, You, et al.
Pubblicazione: (2025)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
di: Sun, Shuang, et al.
Pubblicazione: (2026)
di: Sun, Shuang, et al.
Pubblicazione: (2026)
SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?
di: Tian, Muxin, et al.
Pubblicazione: (2026)
di: Tian, Muxin, et al.
Pubblicazione: (2026)
SWE-Bench-CL: Continual Learning for Coding Agents
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
SWE-smith: Scaling Data for Software Engineering Agents
di: Yang, John, et al.
Pubblicazione: (2025)
di: Yang, John, et al.
Pubblicazione: (2025)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
di: Garg, Spandan, et al.
Pubblicazione: (2025)
di: Garg, Spandan, et al.
Pubblicazione: (2025)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
di: Song, Huatong, et al.
Pubblicazione: (2026)
di: Song, Huatong, et al.
Pubblicazione: (2026)
APEX-SWE
di: Kottamasu, Abhi, et al.
Pubblicazione: (2026)
di: Kottamasu, Abhi, et al.
Pubblicazione: (2026)
SWE-Mirror: Scaling Issue-Resolving Datasets by Mirroring Issues Across Repositories
di: Wang, Junhao, et al.
Pubblicazione: (2025)
di: Wang, Junhao, et al.
Pubblicazione: (2025)
BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?
di: Chen, Guoxin, et al.
Pubblicazione: (2026)
di: Chen, Guoxin, et al.
Pubblicazione: (2026)
SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
di: Tan, Boyin, et al.
Pubblicazione: (2026)
di: Tan, Boyin, et al.
Pubblicazione: (2026)
SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents
di: Zhang, Zhirui, et al.
Pubblicazione: (2026)
di: Zhang, Zhirui, et al.
Pubblicazione: (2026)
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2025)
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2025)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
di: Deng, Xiang, et al.
Pubblicazione: (2025)
di: Deng, Xiang, et al.
Pubblicazione: (2025)
Resolving Java Code Repository Issues with iSWE Agent
di: Ganhotra, Jatin, et al.
Pubblicazione: (2026)
di: Ganhotra, Jatin, et al.
Pubblicazione: (2026)
Investigating Test Overfitting on SWE-bench
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
di: Martinez, Matias, et al.
Pubblicazione: (2026)
di: Martinez, Matias, et al.
Pubblicazione: (2026)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
di: Shetty, Manish, et al.
Pubblicazione: (2025)
di: Shetty, Manish, et al.
Pubblicazione: (2025)
SWE-Effi: Re-Evaluating Software AI Agent System Effectiveness Under Resource Constraints
di: Fan, Zhiyu, et al.
Pubblicazione: (2025)
di: Fan, Zhiyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
di: Han, Hao, et al.
Pubblicazione: (2026) -
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026) -
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
di: Wang, Yuhang, et al.
Pubblicazione: (2026) -
GHIssuemarket: A Sandbox Environment for SWE-Agents Economic Experimentation
di: Fouad, Mohamed A., et al.
Pubblicazione: (2024) -
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
di: Guan, Hao, et al.
Pubblicazione: (2026)