Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Guangtao, Shen, Maohao, Chen, Delin, Qi, Zhenting, Das, Subhro, Gutfreund, Dan, Cox, David, Wornell, Gregory, Lu, Wei, Hong, Zhang-Wei, Gan, Chuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
por: Shen, Maohao, et al.
Publicado: (2025)
por: Shen, Maohao, et al.
Publicado: (2025)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
por: Ding, Yifeng, et al.
Publicado: (2026)
por: Ding, Yifeng, et al.
Publicado: (2026)
SWE-smith: Scaling Data for Software Engineering Agents
por: Yang, John, et al.
Publicado: (2025)
por: Yang, John, et al.
Publicado: (2025)
Thermometer: Towards Universal Calibration for Large Language Models
por: Shen, Maohao, et al.
Publicado: (2024)
por: Shen, Maohao, et al.
Publicado: (2024)
Training Software Engineering Agents and Verifiers with SWE-Gym
por: Pan, Jiayi, et al.
Publicado: (2024)
por: Pan, Jiayi, et al.
Publicado: (2024)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
por: Han, Tingxu, et al.
Publicado: (2026)
por: Han, Tingxu, et al.
Publicado: (2026)
TOM-SWE: User Mental Modeling For Software Engineering Agents
por: Zhou, Xuhui, et al.
Publicado: (2025)
por: Zhou, Xuhui, et al.
Publicado: (2025)
BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
por: Xu, Iris, et al.
Publicado: (2025)
por: Xu, Iris, et al.
Publicado: (2025)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
por: Mhatre, Sanket, et al.
Publicado: (2025)
por: Mhatre, Sanket, et al.
Publicado: (2025)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
por: Ludwig, Nikolai, et al.
Publicado: (2026)
por: Ludwig, Nikolai, et al.
Publicado: (2026)
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
por: Xia, Chunqiu Steven, et al.
Publicado: (2025)
por: Xia, Chunqiu Steven, et al.
Publicado: (2025)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
por: Yuan, Danlong, et al.
Publicado: (2026)
por: Yuan, Danlong, et al.
Publicado: (2026)
SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks
por: Zeng, Yucheng, et al.
Publicado: (2026)
por: Zeng, Yucheng, et al.
Publicado: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
por: Liang, Jiarong, et al.
Publicado: (2026)
por: Liang, Jiarong, et al.
Publicado: (2026)
SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering
por: Zhao, Zhimin
Publicado: (2025)
por: Zhao, Zhimin
Publicado: (2025)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
por: Sun, Shuang, et al.
Publicado: (2026)
por: Sun, Shuang, et al.
Publicado: (2026)
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
por: Han, Hao, et al.
Publicado: (2026)
por: Han, Hao, et al.
Publicado: (2026)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
por: Song, Huatong, et al.
Publicado: (2026)
por: Song, Huatong, et al.
Publicado: (2026)
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
por: Badertdinov, Ibragim, et al.
Publicado: (2025)
por: Badertdinov, Ibragim, et al.
Publicado: (2025)
Reproduction Test Generation for Java SWE Issues
por: Ahmed, Toufique, et al.
Publicado: (2026)
por: Ahmed, Toufique, et al.
Publicado: (2026)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
por: Deng, Xiang, et al.
Publicado: (2025)
por: Deng, Xiang, et al.
Publicado: (2025)
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
por: Badertdinov, Ibragim, et al.
Publicado: (2026)
por: Badertdinov, Ibragim, et al.
Publicado: (2026)
Investigating Test Overfitting on SWE-bench
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
SWE-Mirror: Scaling Issue-Resolving Datasets by Mirroring Issues Across Repositories
por: Wang, Junhao, et al.
Publicado: (2025)
por: Wang, Junhao, et al.
Publicado: (2025)
Are Uncertainty Quantification Capabilities of Evidential Deep Learning a Mirage?
por: Shen, Maohao, et al.
Publicado: (2024)
por: Shen, Maohao, et al.
Publicado: (2024)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
por: Miserendino, Samuel, et al.
Publicado: (2025)
por: Miserendino, Samuel, et al.
Publicado: (2025)
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
por: Yang, John, et al.
Publicado: (2024)
por: Yang, John, et al.
Publicado: (2024)
SWE-Exp: Experience-Driven Software Issue Resolution
por: Chen, Silin, et al.
Publicado: (2025)
por: Chen, Silin, et al.
Publicado: (2025)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
por: Prathifkumar, Thanosan, et al.
Publicado: (2025)
por: Prathifkumar, Thanosan, et al.
Publicado: (2025)
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
por: Wei, Yuxiang, et al.
Publicado: (2025)
por: Wei, Yuxiang, et al.
Publicado: (2025)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
por: Adamenko, Pavel, et al.
Publicado: (2025)
por: Adamenko, Pavel, et al.
Publicado: (2025)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
por: Du, Yaxin, et al.
Publicado: (2025)
por: Du, Yaxin, et al.
Publicado: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
por: Yang, Zeyuan, et al.
Publicado: (2025)
por: Yang, Zeyuan, et al.
Publicado: (2025)
VCA: Video Curious Agent for Long Video Understanding
por: Yang, Zeyuan, et al.
Publicado: (2024)
por: Yang, Zeyuan, et al.
Publicado: (2024)
EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
por: Mao, Chenhui, et al.
Publicado: (2026)
por: Mao, Chenhui, et al.
Publicado: (2026)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
por: Wei, Yuxiang, et al.
Publicado: (2025)
por: Wei, Yuxiang, et al.
Publicado: (2025)
Folklore in Software Engineering: A Definition and Conceptual Foundations
por: Enoiu, Eduard, et al.
Publicado: (2026)
por: Enoiu, Eduard, et al.
Publicado: (2026)
Practical Feasibility of Sustainable Software Engineering Tools and Techniques
por: Ghanta, Satwik, et al.
Publicado: (2026)
por: Ghanta, Satwik, et al.
Publicado: (2026)
Ejemplares similares
-
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
por: Shen, Maohao, et al.
Publicado: (2025) -
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
por: Ding, Yifeng, et al.
Publicado: (2026) -
SWE-smith: Scaling Data for Software Engineering Agents
por: Yang, John, et al.
Publicado: (2025) -
Thermometer: Towards Universal Calibration for Large Language Models
por: Shen, Maohao, et al.
Publicado: (2024) -
Training Software Engineering Agents and Verifiers with SWE-Gym
por: Pan, Jiayi, et al.
Publicado: (2024)