SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Badertdinov, Ibragim, Golubev, Alexander, Nekrashevich, Maksim, Shevtsov, Anton, Karasik, Simon, Andriushchenko, Andrei, Trofimova, Maria, Litvintseva, Daria, Yangel, Boris |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
by: Badertdinov, Ibragim, et al.
Published: (2026)
by: Badertdinov, Ibragim, et al.
Published: (2026)
Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
by: Zainullina, Karina, et al.
Published: (2025)
by: Zainullina, Karina, et al.
Published: (2025)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
by: Golubev, Alexander, et al.
Published: (2025)
by: Golubev, Alexander, et al.
Published: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
by: Pavlenko, Kirill, et al.
Published: (2026)
by: Pavlenko, Kirill, et al.
Published: (2026)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
by: Ludwig, Nikolai, et al.
Published: (2026)
by: Ludwig, Nikolai, et al.
Published: (2026)
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
by: Yang, John, et al.
Published: (2024)
by: Yang, John, et al.
Published: (2024)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
by: Liang, Jiarong, et al.
Published: (2026)
by: Liang, Jiarong, et al.
Published: (2026)
TGPR: Tree-Guided Policy Refinement for Robust Self-Debugging of LLMs
by: Ozerova, Daria, et al.
Published: (2025)
by: Ozerova, Daria, et al.
Published: (2025)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
by: Mhatre, Sanket, et al.
Published: (2025)
by: Mhatre, Sanket, et al.
Published: (2025)
Geological Filmmaking
by: Litvintseva, Sasha
Published: (2022)
by: Litvintseva, Sasha
Published: (2022)
SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks
by: Zeng, Yucheng, et al.
Published: (2026)
by: Zeng, Yucheng, et al.
Published: (2026)
SWE-smith: Scaling Data for Software Engineering Agents
by: Yang, John, et al.
Published: (2025)
by: Yang, John, et al.
Published: (2025)
Training Software Engineering Agents and Verifiers with SWE-Gym
by: Pan, Jiayi, et al.
Published: (2024)
by: Pan, Jiayi, et al.
Published: (2024)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
by: Deng, Xiang, et al.
Published: (2025)
by: Deng, Xiang, et al.
Published: (2025)
Chapter Artistic Expression of the Translatio imperii Concept in the Latin Epic Poetry of the Polish-Lithuanian Commonwealth in the 16th Century and the European Literary Context
by: Nekrashevich-Karotkaja, Zhanna
Published: (2022)
by: Nekrashevich-Karotkaja, Zhanna
Published: (2022)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
by: Shetty, Manish, et al.
Published: (2025)
by: Shetty, Manish, et al.
Published: (2025)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
by: Adamenko, Pavel, et al.
Published: (2025)
by: Adamenko, Pavel, et al.
Published: (2025)
TOM-SWE: User Mental Modeling For Software Engineering Agents
by: Zhou, Xuhui, et al.
Published: (2025)
by: Zhou, Xuhui, et al.
Published: (2025)
SWE-RM: Execution-free Feedback For Software Engineering Agents
by: Shum, KaShun, et al.
Published: (2025)
by: Shum, KaShun, et al.
Published: (2025)
Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
by: Vijayvargiya, Sanidhya, et al.
Published: (2025)
by: Vijayvargiya, Sanidhya, et al.
Published: (2025)
SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering
by: Zhao, Zhimin
Published: (2025)
by: Zhao, Zhimin
Published: (2025)
SWE-Dev: Building Software Engineering Agents with Training and Inference Scaling
by: Wang, Haoran, et al.
Published: (2025)
by: Wang, Haoran, et al.
Published: (2025)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
by: Zeng, Liang, et al.
Published: (2025)
by: Zeng, Liang, et al.
Published: (2025)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
by: Sun, Shuang, et al.
Published: (2026)
by: Sun, Shuang, et al.
Published: (2026)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
by: Ding, Yifeng, et al.
Published: (2026)
by: Ding, Yifeng, et al.
Published: (2026)
Low count of optically pumped magnetometers furnishes a reliable real-time access to sensorimotor rhythm
by: Fedosov, Nikita, et al.
Published: (2024)
by: Fedosov, Nikita, et al.
Published: (2024)
Uncovering Challenges of Solving the Continuous Gromov-Wasserstein Problem
by: Carrasco, Xavier Aramayo, et al.
Published: (2023)
by: Carrasco, Xavier Aramayo, et al.
Published: (2023)
SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation
by: Oliva, Gustavo A., et al.
Published: (2025)
by: Oliva, Gustavo A., et al.
Published: (2025)
SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner
by: Zhang, Lei, et al.
Published: (2025)
by: Zhang, Lei, et al.
Published: (2025)
Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering
by: Zeng, Guangtao, et al.
Published: (2025)
by: Zeng, Guangtao, et al.
Published: (2025)
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
by: Xia, Chunqiu Steven, et al.
Published: (2025)
by: Xia, Chunqiu Steven, et al.
Published: (2025)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
by: Song, Huatong, et al.
Published: (2026)
by: Song, Huatong, et al.
Published: (2026)
Linguacodus: A Synergistic Framework for Transformative Code Generation in Machine Learning Pipelines
by: Trofimova, Ekaterina, et al.
Published: (2024)
by: Trofimova, Ekaterina, et al.
Published: (2024)
CodeRefine: A Pipeline for Enhancing LLM-Generated Code Implementations of Research Papers
by: Trofimova, Ekaterina, et al.
Published: (2024)
by: Trofimova, Ekaterina, et al.
Published: (2024)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
by: Yuan, Danlong, et al.
Published: (2026)
by: Yuan, Danlong, et al.
Published: (2026)
Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement
by: Ma, Yingwei, et al.
Published: (2024)
by: Ma, Yingwei, et al.
Published: (2024)
THz Metal-Mesh Bandpass Filters with Diamond-shaped Apertures for Sensitive THz Receivers
by: Yoo, Changyun, et al.
Published: (2025)
by: Yoo, Changyun, et al.
Published: (2025)
Hot-electron bolometric mixer with negative differential resistance
by: Yoo, Chang, et al.
Published: (2026)
by: Yoo, Chang, et al.
Published: (2026)
Селективные свойства кутков тралов на промысле речной камбалы в Балтийском море.
by: Shevtsov, S.E.
Published: (1980)
by: Shevtsov, S.E.
Published: (1980)
Селективные свойства кутков донных тралов на промысле балтийской трески.
by: Shevtsov, S.E.
Published: (1976)
by: Shevtsov, S.E.
Published: (1976)
Similar Items
-
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
by: Badertdinov, Ibragim, et al.
Published: (2026) -
Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
by: Zainullina, Karina, et al.
Published: (2025) -
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
by: Golubev, Alexander, et al.
Published: (2025) -
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
by: Pavlenko, Kirill, et al.
Published: (2026) -
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
by: Ludwig, Nikolai, et al.
Published: (2026)