GHIssuemarket: A Sandbox Environment for SWE-Agents Economic Experimentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Fouad, Mohamed A., Maia, Marcelo de Almeida |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
di: Yuan, Danlong, et al.
Pubblicazione: (2026)
di: Yuan, Danlong, et al.
Pubblicazione: (2026)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
di: Sun, Shuang, et al.
Pubblicazione: (2026)
di: Sun, Shuang, et al.
Pubblicazione: (2026)
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026)
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026)
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
di: Han, Hao, et al.
Pubblicazione: (2026)
di: Han, Hao, et al.
Pubblicazione: (2026)
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
di: Prathifkumar, Thanosan, et al.
Pubblicazione: (2025)
di: Prathifkumar, Thanosan, et al.
Pubblicazione: (2025)
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
di: Guan, Hao, et al.
Pubblicazione: (2026)
di: Guan, Hao, et al.
Pubblicazione: (2026)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
di: Chen, Mouxiang, et al.
Pubblicazione: (2026)
di: Chen, Mouxiang, et al.
Pubblicazione: (2026)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
di: Ludwig, Nikolai, et al.
Pubblicazione: (2026)
U2F: Encouraging SWE-Agent to Seize Novelty without Losing Feasibility
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
Training Software Engineering Agents and Verifiers with SWE-Gym
di: Pan, Jiayi, et al.
Pubblicazione: (2024)
di: Pan, Jiayi, et al.
Pubblicazione: (2024)
When Agents go Astray: Course-Correcting SWE Agents with PRMs
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
di: Sahoo, Priyam, et al.
Pubblicazione: (2026)
di: Sahoo, Priyam, et al.
Pubblicazione: (2026)
Agents in the Sandbox: End-to-End Crash Bug Reproduction for Minecraft
di: Yapağcı, Eray, et al.
Pubblicazione: (2025)
di: Yapağcı, Eray, et al.
Pubblicazione: (2025)
RepoST: Scalable Repository-Level Coding Environment Construction with Sandbox Testing
di: Xie, Yiqing, et al.
Pubblicazione: (2025)
di: Xie, Yiqing, et al.
Pubblicazione: (2025)
TOM-SWE: User Mental Modeling For Software Engineering Agents
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
di: Raghavendra, Mohit, et al.
Pubblicazione: (2026)
di: Raghavendra, Mohit, et al.
Pubblicazione: (2026)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
di: Aleithan, Reem, et al.
Pubblicazione: (2024)
Reproduction Test Generation for Java SWE Issues
di: Ahmed, Toufique, et al.
Pubblicazione: (2026)
di: Ahmed, Toufique, et al.
Pubblicazione: (2026)
SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?
di: Tian, Muxin, et al.
Pubblicazione: (2026)
di: Tian, Muxin, et al.
Pubblicazione: (2026)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
di: Garg, Spandan, et al.
Pubblicazione: (2025)
di: Garg, Spandan, et al.
Pubblicazione: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2026)
di: Badertdinov, Ibragim, et al.
Pubblicazione: (2026)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
di: Jain, Naman, et al.
Pubblicazione: (2025)
di: Jain, Naman, et al.
Pubblicazione: (2025)
Playing in the Sandbox: A Study on the Usability of Seccomp
di: Alhindi, Maysara, et al.
Pubblicazione: (2025)
di: Alhindi, Maysara, et al.
Pubblicazione: (2025)
daVinci-Env: Open SWE Environment Synthesis at Scale
di: Fu, Dayuan, et al.
Pubblicazione: (2026)
di: Fu, Dayuan, et al.
Pubblicazione: (2026)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
di: Song, Huatong, et al.
Pubblicazione: (2026)
di: Song, Huatong, et al.
Pubblicazione: (2026)
SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
di: Tan, Boyin, et al.
Pubblicazione: (2026)
di: Tan, Boyin, et al.
Pubblicazione: (2026)
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
di: Li, Yuanyang, et al.
Pubblicazione: (2026)
di: Li, Yuanyang, et al.
Pubblicazione: (2026)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
di: Mhatre, Sanket, et al.
Pubblicazione: (2025)
di: Mhatre, Sanket, et al.
Pubblicazione: (2025)
Multi-Programming Language Sandbox for LLMs
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Sandboxing Adoption in Open Source Ecosystems
di: Alhindi, Maysara, et al.
Pubblicazione: (2024)
di: Alhindi, Maysara, et al.
Pubblicazione: (2024)
SWE-Bench-CL: Continual Learning for Coding Agents
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
SWE-smith: Scaling Data for Software Engineering Agents
di: Yang, John, et al.
Pubblicazione: (2025)
di: Yang, John, et al.
Pubblicazione: (2025)
RepoForge: Training a SOTA Fast-thinking SWE Agent with an End-to-End Data Curation Pipeline Synergizing SFT and RL at Scale
di: Chen, Zhilong, et al.
Pubblicazione: (2025)
di: Chen, Zhilong, et al.
Pubblicazione: (2025)
Engineering a Governance-Aware AI Sandbox: Design, Implementation, and Lessons Learned
di: Waseem, Muhammad, et al.
Pubblicazione: (2026)
di: Waseem, Muhammad, et al.
Pubblicazione: (2026)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
di: Ahmed, Toufique, et al.
Pubblicazione: (2025)
Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study
di: Wang, You, et al.
Pubblicazione: (2025)
di: Wang, You, et al.
Pubblicazione: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
di: Martinez, Matias, et al.
Pubblicazione: (2026)
di: Martinez, Matias, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
di: Yuan, Danlong, et al.
Pubblicazione: (2026) -
SWE-World: Building Software Engineering Agents in Docker-Free Environments
di: Sun, Shuang, et al.
Pubblicazione: (2026) -
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
di: Dihan, Mahir Labib, et al.
Pubblicazione: (2026) -
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
di: Han, Hao, et al.
Pubblicazione: (2026) -
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
di: Prathifkumar, Thanosan, et al.
Pubblicazione: (2025)