CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Jiacheng, Pang, Bo, Qu, Jin, Hayashi, Hiroaki, Xiong, Caiming, Zhou, Yingbo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
by: Hayashi, Hiroaki, et al.
Published: (2025)
by: Hayashi, Hiroaki, et al.
Published: (2025)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
by: Liu, Ye, et al.
Published: (2024)
by: Liu, Ye, et al.
Published: (2024)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
by: Qiu, Jielin, et al.
Published: (2025)
by: Qiu, Jielin, et al.
Published: (2025)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
by: Qiu, Jielin, et al.
Published: (2025)
by: Qiu, Jielin, et al.
Published: (2025)
SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization
by: Reddy, Revanth Gangi, et al.
Published: (2025)
by: Reddy, Revanth Gangi, et al.
Published: (2025)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
by: Le, Hung, et al.
Published: (2024)
by: Le, Hung, et al.
Published: (2024)
Clarifying Semantics of In-Context Examples for Unit Test Generation
by: Yang, Chen, et al.
Published: (2025)
by: Yang, Chen, et al.
Published: (2025)
FuzzAug: Data Augmentation by Coverage-guided Fuzzing for Neural Test Generation
by: He, Yifeng, et al.
Published: (2024)
by: He, Yifeng, et al.
Published: (2024)
Verifying LLM-Generated Code in the Context of Software Verification with Ada/SPARK
by: Cramer, Marcos, et al.
Published: (2025)
by: Cramer, Marcos, et al.
Published: (2025)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
by: Fu, Jia, et al.
Published: (2025)
by: Fu, Jia, et al.
Published: (2025)
On the Effectiveness of LLMs for Manual Test Verifications
by: Peixoto, Myron David Lucena Campos, et al.
Published: (2024)
by: Peixoto, Myron David Lucena Campos, et al.
Published: (2024)
YABLoCo: Yet Another Benchmark for Long Context Code Generation
by: Valeev, Aidar, et al.
Published: (2025)
by: Valeev, Aidar, et al.
Published: (2025)
Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
by: Zhang, Kexun, et al.
Published: (2024)
by: Zhang, Kexun, et al.
Published: (2024)
Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation
by: Cui, Yi
Published: (2025)
by: Cui, Yi
Published: (2025)
RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements
by: Kogler, Leon, et al.
Published: (2026)
by: Kogler, Leon, et al.
Published: (2026)
LLM-Based Test Case Generation in DBMS through Monte Carlo Tree Search
by: Chen, Yujia, et al.
Published: (2026)
by: Chen, Yujia, et al.
Published: (2026)
The Future of Software Testing: AI-Powered Test Case Generation and Validation
by: Baqar, Mohammad, et al.
Published: (2024)
by: Baqar, Mohammad, et al.
Published: (2024)
UnitTenX: Generating Tests for Legacy Packages with AI Agents Powered by Formal Verification
by: Charalambous, Yiannis, et al.
Published: (2025)
by: Charalambous, Yiannis, et al.
Published: (2025)
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
by: Hu, Ruida, et al.
Published: (2025)
by: Hu, Ruida, et al.
Published: (2025)
LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost
by: Huang, Donghao, et al.
Published: (2025)
by: Huang, Donghao, et al.
Published: (2025)
SweRank: Software Issue Localization with Code Ranking
by: Reddy, Revanth Gangi, et al.
Published: (2025)
by: Reddy, Revanth Gangi, et al.
Published: (2025)
LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming
by: Sung, Sicheol, et al.
Published: (2025)
by: Sung, Sicheol, et al.
Published: (2025)
exLong: Generating Exceptional Behavior Tests with Large Language Models
by: Zhang, Jiyang, et al.
Published: (2024)
by: Zhang, Jiyang, et al.
Published: (2024)
Revisit Self-Debugging with Self-Generated Tests for Code Generation
by: Chen, Xiancai, et al.
Published: (2025)
by: Chen, Xiancai, et al.
Published: (2025)
Loosely-Structured Software: Engineering Context, Structure, and Evolution Entropy in Runtime-Rewired Multi-Agent Systems
by: Zhang, Weihao, et al.
Published: (2026)
by: Zhang, Weihao, et al.
Published: (2026)
Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors
by: Li, Henger, et al.
Published: (2025)
by: Li, Henger, et al.
Published: (2025)
SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation
by: Oliva, Gustavo A., et al.
Published: (2025)
by: Oliva, Gustavo A., et al.
Published: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
by: Guo, Chengquan, et al.
Published: (2024)
by: Guo, Chengquan, et al.
Published: (2024)
Just-in-Time Catching Test Generation at Meta
by: Becker, Matthew, et al.
Published: (2026)
by: Becker, Matthew, et al.
Published: (2026)
Lyra: A Benchmark for Turducken-Style Code Generation
by: Liang, Qingyuan, et al.
Published: (2021)
by: Liang, Qingyuan, et al.
Published: (2021)
Domain Adaptation for Code Model-based Unit Test Case Generation
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
Large Language Models as Test Case Generators: Performance Evaluation and Enhancement
by: Li, Kefan, et al.
Published: (2024)
by: Li, Kefan, et al.
Published: (2024)
Automated Unit Test Case Generation: A Systematic Literature Review
by: Wang, Jason, et al.
Published: (2025)
by: Wang, Jason, et al.
Published: (2025)
Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern General-Purpose Large Language Models
by: Walczak, Jakub, et al.
Published: (2025)
by: Walczak, Jakub, et al.
Published: (2025)
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
by: He, Zehai, et al.
Published: (2026)
by: He, Zehai, et al.
Published: (2026)
FastCoder: Accelerating Repository-level Code Generation via Efficient Retrieval and Verification
by: Zhao, Qianhui, et al.
Published: (2025)
by: Zhao, Qianhui, et al.
Published: (2025)
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
by: Kokane, Shirley, et al.
Published: (2024)
by: Kokane, Shirley, et al.
Published: (2024)
Fuzzy Inference System for Test Case Prioritization in Software Testing
by: Karatayev, Aron, et al.
Published: (2024)
by: Karatayev, Aron, et al.
Published: (2024)
AutoTest: Evolutionary Code Solution Selection with Test Cases
by: Duan, Zhihua, et al.
Published: (2024)
by: Duan, Zhihua, et al.
Published: (2024)
Similar Items
-
Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
by: Hayashi, Hiroaki, et al.
Published: (2025) -
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
by: Liu, Ye, et al.
Published: (2024) -
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
by: Qiu, Jielin, et al.
Published: (2025) -
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
by: Qiu, Jielin, et al.
Published: (2025) -
SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization
by: Reddy, Revanth Gangi, et al.
Published: (2025)