Otter: Generating Tests from Issues to Validate SWE Patches
Fuente:
arXiv
Guardado en:
| Autores principales: | Ahmed, Toufique, Ganhotra, Jatin, Pan, Rangeet, Shinnar, Avraham, Sinha, Saurabh, Hirzel, Martin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Investigating Test Overfitting on SWE-bench
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
Reproduction Test Generation for Java SWE Issues
por: Ahmed, Toufique, et al.
Publicado: (2026)
por: Ahmed, Toufique, et al.
Publicado: (2026)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
por: Ahmed, Toufique, et al.
Publicado: (2025)
por: Ahmed, Toufique, et al.
Publicado: (2025)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
por: Ahmed, Toufique, et al.
Publicado: (2024)
por: Ahmed, Toufique, et al.
Publicado: (2024)
Resolving Java Code Repository Issues with iSWE Agent
por: Ganhotra, Jatin, et al.
Publicado: (2026)
por: Ganhotra, Jatin, et al.
Publicado: (2026)
Can Old Tests Do New Tricks for Resolving SWE Issues?
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2024)
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2024)
Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions
por: Stennett, Tyler, et al.
Publicado: (2026)
por: Stennett, Tyler, et al.
Publicado: (2026)
ASTER: Natural and Multi-language Unit Test Generation with LLMs
por: Pan, Rangeet, et al.
Publicado: (2024)
por: Pan, Rangeet, et al.
Publicado: (2024)
Evaluating Plan Compliance in Autonomous Programming Agents
por: Liu, Shuyang, et al.
Publicado: (2026)
por: Liu, Shuyang, et al.
Publicado: (2026)
When Agents go Astray: Course-Correcting SWE Agents with PRMs
por: Gandhi, Shubham, et al.
Publicado: (2025)
por: Gandhi, Shubham, et al.
Publicado: (2025)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
por: Pai, Kunal, et al.
Publicado: (2025)
por: Pai, Kunal, et al.
Publicado: (2025)
Studying LLM Performance on Closed- and Open-source Data
por: Ahmed, Toufique, et al.
Publicado: (2024)
por: Ahmed, Toufique, et al.
Publicado: (2024)
Hamster: A Large-Scale Study and Characterization of Developer-Written Tests
por: Pan, Rangeet, et al.
Publicado: (2025)
por: Pan, Rangeet, et al.
Publicado: (2025)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
por: Ahmed, Toufique, et al.
Publicado: (2023)
por: Ahmed, Toufique, et al.
Publicado: (2023)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
por: Ke, Kaiyao, et al.
Publicado: (2025)
por: Ke, Kaiyao, et al.
Publicado: (2025)
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
por: Raghavendra, Mohit, et al.
Publicado: (2026)
por: Raghavendra, Mohit, et al.
Publicado: (2026)
Process-Centric Analysis of Agentic Software Systems
por: Liu, Shuyang, et al.
Publicado: (2025)
por: Liu, Shuyang, et al.
Publicado: (2025)
SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories
por: Soni, Aditya Bharat, et al.
Publicado: (2026)
por: Soni, Aditya Bharat, et al.
Publicado: (2026)
SWE-Exp: Experience-Driven Software Issue Resolution
por: Chen, Silin, et al.
Publicado: (2025)
por: Chen, Silin, et al.
Publicado: (2025)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
por: Ding, Yifeng, et al.
Publicado: (2026)
por: Ding, Yifeng, et al.
Publicado: (2026)
Can LLMs Replace Manual Annotation of Software Engineering Artifacts?
por: Ahmed, Toufique, et al.
Publicado: (2024)
por: Ahmed, Toufique, et al.
Publicado: (2024)
Trojans in Large Language Models of Code: A Critical Review through a Trigger-Based Taxonomy
por: Hussain, Aftab, et al.
Publicado: (2024)
por: Hussain, Aftab, et al.
Publicado: (2024)
How Safe Are AI-Generated Patches? A Large-scale Study on Security Risks in LLM and Agentic Automated Program Repair on SWE-bench
por: Sajadi, Amirali, et al.
Publicado: (2025)
por: Sajadi, Amirali, et al.
Publicado: (2025)
Codellm-Devkit: A Framework for Contextualizing Code LLMs with Program Analysis Insights
por: Krishna, Rahul, et al.
Publicado: (2024)
por: Krishna, Rahul, et al.
Publicado: (2024)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
por: Haider, Md. Asif, et al.
Publicado: (2024)
por: Haider, Md. Asif, et al.
Publicado: (2024)
SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution
por: Li, Han, et al.
Publicado: (2025)
por: Li, Han, et al.
Publicado: (2025)
SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering
por: Zhao, Zhimin
Publicado: (2025)
por: Zhao, Zhimin
Publicado: (2025)
SAINT: Service-level Integration Test Generation with Program Analysis and LLM-based Agents
por: Pan, Rangeet, et al.
Publicado: (2025)
por: Pan, Rangeet, et al.
Publicado: (2025)
Towards Understanding What Code Language Models Learned
por: Ahmed, Toufique, et al.
Publicado: (2023)
por: Ahmed, Toufique, et al.
Publicado: (2023)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
por: Wang, Lilin, et al.
Publicado: (2025)
por: Wang, Lilin, et al.
Publicado: (2025)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
por: Miserendino, Samuel, et al.
Publicado: (2025)
por: Miserendino, Samuel, et al.
Publicado: (2025)
ITER: Iterative Neural Repair for Multi-Location Patches
por: Ye, He, et al.
Publicado: (2023)
por: Ye, He, et al.
Publicado: (2023)
SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution
por: He, Kang, et al.
Publicado: (2026)
por: He, Kang, et al.
Publicado: (2026)
Calibration and Correctness of Language Models for Code
por: Spiess, Claudio, et al.
Publicado: (2024)
por: Spiess, Claudio, et al.
Publicado: (2024)
SWE-Bench-CL: Continual Learning for Coding Agents
por: Joshi, Thomas, et al.
Publicado: (2025)
por: Joshi, Thomas, et al.
Publicado: (2025)
Timing Analysis Agent: Autonomous Multi-Corner Multi-Mode (MCMM) Timing Debugging with Timing Debug Relation Graph
por: Nainani, Jatin, et al.
Publicado: (2025)
por: Nainani, Jatin, et al.
Publicado: (2025)
Latent Regularization in Generative Test Input Generation
por: Merabishvili, Giorgi, et al.
Publicado: (2026)
por: Merabishvili, Giorgi, et al.
Publicado: (2026)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
por: Yuan, Danlong, et al.
Publicado: (2026)
por: Yuan, Danlong, et al.
Publicado: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
por: Huang, Jiawei, et al.
Publicado: (2026)
por: Huang, Jiawei, et al.
Publicado: (2026)
Ejemplares similares
-
Investigating Test Overfitting on SWE-bench
por: Ahmed, Toufique, et al.
Publicado: (2025) -
Reproduction Test Generation for Java SWE Issues
por: Ahmed, Toufique, et al.
Publicado: (2026) -
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
por: Ahmed, Toufique, et al.
Publicado: (2025) -
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
por: Ahmed, Toufique, et al.
Publicado: (2024) -
Resolving Java Code Repository Issues with iSWE Agent
por: Ganhotra, Jatin, et al.
Publicado: (2026)