Toward Training Superintelligent Software Agents through Self-Play SWE-RL
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wei, Yuxiang, Sun, Zhiqing, McMilin, Emily, Gehring, Jonas, Zhang, David, Synnaeve, Gabriel, Fried, Daniel, Zhang, Lingming, Wang, Sida |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
von: Wei, Yuxiang, et al.
Veröffentlicht: (2025)
von: Wei, Yuxiang, et al.
Veröffentlicht: (2025)
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2025)
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2025)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
von: Ding, Yifeng, et al.
Veröffentlicht: (2026)
von: Ding, Yifeng, et al.
Veröffentlicht: (2026)
Towards a Neural Debugger for Python
von: Beck, Maximilian, et al.
Veröffentlicht: (2026)
von: Beck, Maximilian, et al.
Veröffentlicht: (2026)
Underspecification in Language Modeling Tasks: A Causality-Informed Study of Gendered Pronoun Resolution
von: McMilin, Emily
Veröffentlicht: (2022)
von: McMilin, Emily
Veröffentlicht: (2022)
Training Software Engineering Agents and Verifiers with SWE-Gym
von: Pan, Jiayi, et al.
Veröffentlicht: (2024)
von: Pan, Jiayi, et al.
Veröffentlicht: (2024)
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
von: Yang, John, et al.
Veröffentlicht: (2024)
von: Yang, John, et al.
Veröffentlicht: (2024)
ProgramBench: Can Language Models Rebuild Programs From Scratch?
von: Yang, John, et al.
Veröffentlicht: (2026)
von: Yang, John, et al.
Veröffentlicht: (2026)
SWE-Effi: Re-Evaluating Software AI Agent System Effectiveness Under Resource Constraints
von: Fan, Zhiyu, et al.
Veröffentlicht: (2025)
von: Fan, Zhiyu, et al.
Veröffentlicht: (2025)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
von: Song, Huatong, et al.
Veröffentlicht: (2026)
von: Song, Huatong, et al.
Veröffentlicht: (2026)
Practical Program Repair in the Era of Large Pre-trained Language Models
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents
von: Zhang, Zhirui, et al.
Veröffentlicht: (2026)
von: Zhang, Zhirui, et al.
Veröffentlicht: (2026)
SWE-smith: Scaling Data for Software Engineering Agents
von: Yang, John, et al.
Veröffentlicht: (2025)
von: Yang, John, et al.
Veröffentlicht: (2025)
Less Training, More Repairing Please: Revisiting Automated Program Repair via Zero-shot Learning
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2022)
RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale
von: Chen, Zhilong, et al.
Veröffentlicht: (2025)
von: Chen, Zhilong, et al.
Veröffentlicht: (2025)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
von: Sun, Shuang, et al.
Veröffentlicht: (2026)
von: Sun, Shuang, et al.
Veröffentlicht: (2026)
TOM-SWE: User Mental Modeling For Software Engineering Agents
von: Zhou, Xuhui, et al.
Veröffentlicht: (2025)
von: Zhou, Xuhui, et al.
Veröffentlicht: (2025)
Agentless: Demystifying LLM-based Software Engineering Agents
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2024)
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2024)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
von: Ludwig, Nikolai, et al.
Veröffentlicht: (2026)
von: Ludwig, Nikolai, et al.
Veröffentlicht: (2026)
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
von: Wang, Yuhang, et al.
Veröffentlicht: (2026)
von: Wang, Yuhang, et al.
Veröffentlicht: (2026)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
von: Du, Yaxin, et al.
Veröffentlicht: (2025)
von: Du, Yaxin, et al.
Veröffentlicht: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
von: Liang, Jiarong, et al.
Veröffentlicht: (2026)
von: Liang, Jiarong, et al.
Veröffentlicht: (2026)
SWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR Training
von: Wen, Xin-Cheng, et al.
Veröffentlicht: (2026)
von: Wen, Xin-Cheng, et al.
Veröffentlicht: (2026)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
von: Han, Tingxu, et al.
Veröffentlicht: (2026)
von: Han, Tingxu, et al.
Veröffentlicht: (2026)
UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging
von: Lee, Cheryl, et al.
Veröffentlicht: (2024)
von: Lee, Cheryl, et al.
Veröffentlicht: (2024)
Large Language Model-Based Agents for Software Engineering: A Survey
von: Liu, Junwei, et al.
Veröffentlicht: (2024)
von: Liu, Junwei, et al.
Veröffentlicht: (2024)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
von: Yuan, Danlong, et al.
Veröffentlicht: (2026)
von: Yuan, Danlong, et al.
Veröffentlicht: (2026)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
von: Yang, Zonghan, et al.
Veröffentlicht: (2025)
von: Yang, Zonghan, et al.
Veröffentlicht: (2025)
TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark
von: Jain, Kush, et al.
Veröffentlicht: (2024)
von: Jain, Kush, et al.
Veröffentlicht: (2024)
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
von: Li, Han, et al.
Veröffentlicht: (2025)
von: Li, Han, et al.
Veröffentlicht: (2025)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
von: Deng, Xiang, et al.
Veröffentlicht: (2025)
von: Deng, Xiang, et al.
Veröffentlicht: (2025)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
von: Shetty, Manish, et al.
Veröffentlicht: (2025)
von: Shetty, Manish, et al.
Veröffentlicht: (2025)
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
von: Han, Hao, et al.
Veröffentlicht: (2026)
von: Han, Hao, et al.
Veröffentlicht: (2026)
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
von: Badertdinov, Ibragim, et al.
Veröffentlicht: (2025)
von: Badertdinov, Ibragim, et al.
Veröffentlicht: (2025)
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
von: Guan, Hao, et al.
Veröffentlicht: (2026)
von: Guan, Hao, et al.
Veröffentlicht: (2026)
SEAlign: Alignment Training for Software Engineering Agent
von: Zhang, Kechi, et al.
Veröffentlicht: (2025)
von: Zhang, Kechi, et al.
Veröffentlicht: (2025)
SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies
von: Saxena, Siddhant, et al.
Veröffentlicht: (2026)
von: Saxena, Siddhant, et al.
Veröffentlicht: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
von: Gu, Alex, et al.
Veröffentlicht: (2024)
von: Gu, Alex, et al.
Veröffentlicht: (2024)
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
von: Dihan, Mahir Labib, et al.
Veröffentlicht: (2026)
von: Dihan, Mahir Labib, et al.
Veröffentlicht: (2026)
ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents
von: Li, Kenan, et al.
Veröffentlicht: (2026)
von: Li, Kenan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
von: Wei, Yuxiang, et al.
Veröffentlicht: (2025) -
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
von: Xia, Chunqiu Steven, et al.
Veröffentlicht: (2025) -
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
von: Ding, Yifeng, et al.
Veröffentlicht: (2026) -
Towards a Neural Debugger for Python
von: Beck, Maximilian, et al.
Veröffentlicht: (2026) -
Underspecification in Language Modeling Tasks: A Causality-Informed Study of Gendered Pronoun Resolution
von: McMilin, Emily
Veröffentlicht: (2022)