TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
Fuente:
arXiv
Saved in:
| Main Authors: | Ahmed, Toufique, Hirzel, Martin, Pan, Rangeet, Shinnar, Avraham, Sinha, Saurabh |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Otter: Generating Tests from Issues to Validate SWE Patches
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
Reproduction Test Generation for Java SWE Issues
by: Ahmed, Toufique, et al.
Published: (2026)
by: Ahmed, Toufique, et al.
Published: (2026)
Investigating Test Overfitting on SWE-bench
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
Resolving Java Code Repository Issues with iSWE Agent
by: Ganhotra, Jatin, et al.
Published: (2026)
by: Ganhotra, Jatin, et al.
Published: (2026)
ASTER: Natural and Multi-language Unit Test Generation with LLMs
by: Pan, Rangeet, et al.
Published: (2024)
by: Pan, Rangeet, et al.
Published: (2024)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
by: Ke, Kaiyao, et al.
Published: (2025)
by: Ke, Kaiyao, et al.
Published: (2025)
Sakura: An Approach for Generating Complex Tests from Natural Language Test Descriptions
by: Stennett, Tyler, et al.
Published: (2026)
by: Stennett, Tyler, et al.
Published: (2026)
CoDocBench: A Dataset for Code-Documentation Alignment in Software Maintenance
by: Pai, Kunal, et al.
Published: (2025)
by: Pai, Kunal, et al.
Published: (2025)
Hamster: A Large-Scale Study and Characterization of Developer-Written Tests
by: Pan, Rangeet, et al.
Published: (2025)
by: Pan, Rangeet, et al.
Published: (2025)
Codellm-Devkit: A Framework for Contextualizing Code LLMs with Program Analysis Insights
by: Krishna, Rahul, et al.
Published: (2024)
by: Krishna, Rahul, et al.
Published: (2024)
Can LLMs Replace Manual Annotation of Software Engineering Artifacts?
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
by: Haider, Md. Asif, et al.
Published: (2024)
by: Haider, Md. Asif, et al.
Published: (2024)
Calibration of Large Language Models on Code Summarization
by: Virk, Yuvraj, et al.
Published: (2024)
by: Virk, Yuvraj, et al.
Published: (2024)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
Towards Understanding What Code Language Models Learned
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
SERA: Soft-Verified Efficient Repository Agents
by: Shen, Ethan, et al.
Published: (2026)
by: Shen, Ethan, et al.
Published: (2026)
SAINT: Service-level Integration Test Generation with Program Analysis and LLM-based Agents
by: Pan, Rangeet, et al.
Published: (2025)
by: Pan, Rangeet, et al.
Published: (2025)
CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?
by: Bhargava, Vaishnavi, et al.
Published: (2024)
by: Bhargava, Vaishnavi, et al.
Published: (2024)
Representing Prompting Patterns with PDL: Compliance Agent Case Study
by: Vaziri, Mandana, et al.
Published: (2025)
by: Vaziri, Mandana, et al.
Published: (2025)
Studying LLM Performance on Closed- and Open-source Data
by: Ahmed, Toufique, et al.
Published: (2024)
by: Ahmed, Toufique, et al.
Published: (2024)
A Comparative Study on the Impact of Test-Driven Development (TDD) and Behavior-Driven Development (BDD) on Enterprise Software Delivery Effectiveness
by: Cui, Jun
Published: (2024)
by: Cui, Jun
Published: (2024)
PoTo: A Hybrid Andersen's Points-to Analysis for Python
by: Rak-amnouykit, Ingkarat, et al.
Published: (2024)
by: Rak-amnouykit, Ingkarat, et al.
Published: (2024)
CodeRAG-Bench: Can Retrieval Augment Code Generation?
by: Wang, Zora Zhiruo, et al.
Published: (2024)
by: Wang, Zora Zhiruo, et al.
Published: (2024)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
by: Khatry, Anirudh, et al.
Published: (2025)
by: Khatry, Anirudh, et al.
Published: (2025)
Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure
by: Yang, Zheyuan, et al.
Published: (2025)
by: Yang, Zheyuan, et al.
Published: (2025)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
by: Chen, Zaoyu, et al.
Published: (2026)
by: Chen, Zaoyu, et al.
Published: (2026)
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories
by: Wang, Lilin, et al.
Published: (2025)
by: Wang, Lilin, et al.
Published: (2025)
Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis
by: Gajjar, Jugal
Published: (2026)
by: Gajjar, Jugal
Published: (2026)
AutoBench: Automatic Testbench Generation and Evaluation Using LLMs for HDL Design
by: Qiu, Ruidi, et al.
Published: (2024)
by: Qiu, Ruidi, et al.
Published: (2024)
SEVerA: Verified Synthesis of Self-Evolving Agents
by: Banerjee, Debangshu, et al.
Published: (2026)
by: Banerjee, Debangshu, et al.
Published: (2026)
How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models
by: Corbo, Simone, et al.
Published: (2025)
by: Corbo, Simone, et al.
Published: (2025)
OSS-Bench: Benchmark Generator for Coding LLMs
by: Jiang, Yuancheng, et al.
Published: (2025)
by: Jiang, Yuancheng, et al.
Published: (2025)
CONCUR: Benchmarking LLMs for Concurrent Code Generation
by: Huang, Jue, et al.
Published: (2026)
by: Huang, Jue, et al.
Published: (2026)
Evaluating Plan Compliance in Autonomous Programming Agents
by: Liu, Shuyang, et al.
Published: (2026)
by: Liu, Shuyang, et al.
Published: (2026)
Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems
by: Cao, Yuhan, et al.
Published: (2025)
by: Cao, Yuhan, et al.
Published: (2025)
AutoRestTest: A Tool for Automated REST API Testing Using LLMs and MARL
by: Stennett, Tyler, et al.
Published: (2025)
by: Stennett, Tyler, et al.
Published: (2025)
Test Code Generation for Telecom Software Systems using Two-Stage Generative Model
by: Nabeel, Mohamad, et al.
Published: (2024)
by: Nabeel, Mohamad, et al.
Published: (2024)
Similar Items
-
Otter: Generating Tests from Issues to Validate SWE Patches
by: Ahmed, Toufique, et al.
Published: (2025) -
Reproduction Test Generation for Java SWE Issues
by: Ahmed, Toufique, et al.
Published: (2026) -
Investigating Test Overfitting on SWE-bench
by: Ahmed, Toufique, et al.
Published: (2025) -
Heterogeneous Prompting and Execution Feedback for SWE Issue Test Generation and Selection
by: Ahmed, Toufique, et al.
Published: (2025) -
Can Old Tests Do New Tricks for Resolving SWE Issues?
by: Chen, Yang, et al.
Published: (2025)