SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories
Fuente:
arXiv
Guardado en:
| Autores principales: | Soni, Aditya Bharat, Ghosh, Rajat, Bhargava, Vaishnavi, Chen, Valerie, Dutta, Debojyoti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?
por: Bhargava, Vaishnavi, et al.
Publicado: (2024)
por: Bhargava, Vaishnavi, et al.
Publicado: (2024)
RANGER -- Repository-Level Agent for Graph-Enhanced Retrieval
por: Shah, Pratik, et al.
Publicado: (2025)
por: Shah, Pratik, et al.
Publicado: (2025)
A Multi-Agent Framework for Stateful Inference-Time Search
por: Lalan, Arshika, et al.
Publicado: (2025)
por: Lalan, Arshika, et al.
Publicado: (2025)
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
por: Pereira, Kristen, et al.
Publicado: (2026)
por: Pereira, Kristen, et al.
Publicado: (2026)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
por: Xu, Yisen, et al.
Publicado: (2026)
por: Xu, Yisen, et al.
Publicado: (2026)
SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
por: He, Xinyi, et al.
Publicado: (2025)
por: He, Xinyi, et al.
Publicado: (2025)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
por: Wang, Lilin, et al.
Publicado: (2025)
por: Wang, Lilin, et al.
Publicado: (2025)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
por: Miserendino, Samuel, et al.
Publicado: (2025)
por: Miserendino, Samuel, et al.
Publicado: (2025)
Reproduction Test Generation for Java SWE Issues
por: Ahmed, Toufique, et al.
Publicado: (2026)
por: Ahmed, Toufique, et al.
Publicado: (2026)
SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?
por: Ma, Jeffrey Jian, et al.
Publicado: (2025)
por: Ma, Jeffrey Jian, et al.
Publicado: (2025)
SWE-Mirror: Scaling Issue-Resolving Datasets by Mirroring Issues Across Repositories
por: Wang, Junhao, et al.
Publicado: (2025)
por: Wang, Junhao, et al.
Publicado: (2025)
SWE-Spot: Building Small Repo-Experts with Repository-Centric Learning
por: Peng, Jinjun, et al.
Publicado: (2026)
por: Peng, Jinjun, et al.
Publicado: (2026)
Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models
por: Nimmaturi, Datta, et al.
Publicado: (2025)
por: Nimmaturi, Datta, et al.
Publicado: (2025)
Otter: Generating Tests from Issues to Validate SWE Patches
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
por: Raghavendra, Mohit, et al.
Publicado: (2026)
por: Raghavendra, Mohit, et al.
Publicado: (2026)
Exploring the Lifecycle and Maintenance Practices of Pre-Trained Models in Open-Source Software Repositories
por: Koohjani, Matin, et al.
Publicado: (2025)
por: Koohjani, Matin, et al.
Publicado: (2025)
SWE-Exp: Experience-Driven Software Issue Resolution
por: Chen, Silin, et al.
Publicado: (2025)
por: Chen, Silin, et al.
Publicado: (2025)
Resolving Java Code Repository Issues with iSWE Agent
por: Ganhotra, Jatin, et al.
Publicado: (2026)
por: Ganhotra, Jatin, et al.
Publicado: (2026)
Automated Mapping of Vulnerability Advisories onto their Fix Commits in Open Source Repositories
por: Hommersom, Daan, et al.
Publicado: (2021)
por: Hommersom, Daan, et al.
Publicado: (2021)
An Empirical Validation of Open Source Repository Stability Metrics
por: Adejumo, Elijah Kayode, et al.
Publicado: (2025)
por: Adejumo, Elijah Kayode, et al.
Publicado: (2025)
Action Shapley: A Training Data Selection Metric for World Model in Reinforcement Learning
por: Ghosh, Rajat, et al.
Publicado: (2026)
por: Ghosh, Rajat, et al.
Publicado: (2026)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
por: Chen, Mouxiang, et al.
Publicado: (2026)
por: Chen, Mouxiang, et al.
Publicado: (2026)
Investigating Test Overfitting on SWE-bench
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
por: Liang, Jiarong, et al.
Publicado: (2026)
por: Liang, Jiarong, et al.
Publicado: (2026)
GiveMeLabeledIssues: An Open Source Issue Recommendation System
por: Vargovich, Joseph, et al.
Publicado: (2023)
por: Vargovich, Joseph, et al.
Publicado: (2023)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
por: Aleithan, Reem, et al.
Publicado: (2024)
por: Aleithan, Reem, et al.
Publicado: (2024)
Breaking Single-Tester Limits: Multi-Agent LLMs for Multi-User Feature Testing
por: Feng, Sidong, et al.
Publicado: (2025)
por: Feng, Sidong, et al.
Publicado: (2025)
Classifying Issues in Open-source GitHub Repositories
por: Raaj, Amir Hossain, et al.
Publicado: (2025)
por: Raaj, Amir Hossain, et al.
Publicado: (2025)
BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
por: Zhou, Jinan, et al.
Publicado: (2025)
por: Zhou, Jinan, et al.
Publicado: (2025)
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
por: Li, Han, et al.
Publicado: (2025)
por: Li, Han, et al.
Publicado: (2025)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
por: Cai, Songcheng, et al.
Publicado: (2026)
por: Cai, Songcheng, et al.
Publicado: (2026)
Revealing the value of Repository Centrality in lifespan prediction of Open Source Software Projects
por: He, Runzhi, et al.
Publicado: (2024)
por: He, Runzhi, et al.
Publicado: (2024)
The Product Beyond the Model -- An Empirical Study of Repositories of Open-Source ML Products
por: Nahar, Nadia, et al.
Publicado: (2023)
por: Nahar, Nadia, et al.
Publicado: (2023)
Go-UT-Bench: A Fine-Tuning Dataset for LLM-Based Unit Test Generation in Go
por: Pipalani, Yashshi, et al.
Publicado: (2025)
por: Pipalani, Yashshi, et al.
Publicado: (2025)
SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering
por: Zhao, Zhimin
Publicado: (2025)
por: Zhao, Zhimin
Publicado: (2025)
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
por: Jimenez, Carlos E., et al.
Publicado: (2023)
por: Jimenez, Carlos E., et al.
Publicado: (2023)
Are Autonomous Web Agents Good Testers?
por: Chevrot, Antoine, et al.
Publicado: (2025)
por: Chevrot, Antoine, et al.
Publicado: (2025)
HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench
por: Wang, Yueyang, et al.
Publicado: (2026)
por: Wang, Yueyang, et al.
Publicado: (2026)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
por: Jain, Naman, et al.
Publicado: (2025)
por: Jain, Naman, et al.
Publicado: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?
por: Bhargava, Vaishnavi, et al.
Publicado: (2024) -
RANGER -- Repository-Level Agent for Graph-Enhanced Retrieval
por: Shah, Pratik, et al.
Publicado: (2025) -
A Multi-Agent Framework for Stateful Inference-Time Search
por: Lalan, Arshika, et al.
Publicado: (2025) -
CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents
por: Pereira, Kristen, et al.
Publicado: (2026) -
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
por: Xu, Yisen, et al.
Publicado: (2026)