Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution
Fuente:
arXiv
Saved in:
| Main Authors: | Shang, Ye, Zhang, Quanjun, Hu, Haichuan, Fang, Chunrong, Xiao, Liang, Chen, Zhenyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
ComPass: Contrastive Learning for Automated Patch Correctness Assessment in Program Repair
by: Zhang, Quanjun, et al.
Published: (2026)
by: Zhang, Quanjun, et al.
Published: (2026)
On the Effectiveness of Code Representation in Deep Learning-Based Automated Patch Correctness Assessment
by: Zhang, Quanjun, et al.
Published: (2026)
by: Zhang, Quanjun, et al.
Published: (2026)
EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
SGAgent: Suggestion-Guided LLM-Based Multi-Agent Framework for Repository-Level Software Repair
by: Zhang, Quanjun, et al.
Published: (2026)
by: Zhang, Quanjun, et al.
Published: (2026)
Large Language Models for Unit Testing: A Systematic Literature Review
by: Zhang, Quanjun, et al.
Published: (2025)
by: Zhang, Quanjun, et al.
Published: (2025)
ATTest: Agent-Driven Tensor Testing for Deep Learning Library Modules
by: Zhan, Zhengyu, et al.
Published: (2026)
by: Zhan, Zhengyu, et al.
Published: (2026)
No Man is an Island: Towards Fully Automatic Programming by Code Search, Code Generation and Program Repair
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
A Large-scale Empirical Study on Fine-tuning Large Language Models for Unit Testing
by: Shang, Ye, et al.
Published: (2024)
by: Shang, Ye, et al.
Published: (2024)
ACTesting: Automated Cross-modal Testing Method of Text-to-Image Software
by: Gu, Siqi, et al.
Published: (2023)
by: Gu, Siqi, et al.
Published: (2023)
TSAPR: A Tree Search Framework For Automated Program Repair
by: Hu, Haichuan, et al.
Published: (2025)
by: Hu, Haichuan, et al.
Published: (2025)
Machine Translation Testing via Syntactic Tree Pruning
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
Repair-R1: Better Test Before Repair
by: Hu, Haichuan, et al.
Published: (2025)
by: Hu, Haichuan, et al.
Published: (2025)
Vision-Based Mobile App GUI Testing: A Survey
by: Yu, Shengcheng, et al.
Published: (2023)
by: Yu, Shengcheng, et al.
Published: (2023)
Test Script Intention Generation for Mobile Application via GUI Image and Code Understanding
by: Yu, Shengcheng, et al.
Published: (2021)
by: Yu, Shengcheng, et al.
Published: (2021)
TestART: Improving LLM-based Unit Testing via Co-evolution of Automated Generation and Repair Iteration
by: Gu, Siqi, et al.
Published: (2024)
by: Gu, Siqi, et al.
Published: (2024)
Can GPT-O1 Kill All Bugs? An Evaluation of GPT-Family LLMs on QuixBugs
by: Hu, Haichuan, et al.
Published: (2024)
by: Hu, Haichuan, et al.
Published: (2024)
A Critical Review of Large Language Model on Software Engineering: An Example from ChatGPT and Automated Program Repair
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
APPT: Boosting Automated Patch Correctness Prediction via Fine-tuning Pre-trained Models
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
Improving Deep Learning Framework Testing with Model-Level Metamorphic Testing
by: Mu, Yanzhou, et al.
Published: (2025)
by: Mu, Yanzhou, et al.
Published: (2025)
A Systematic Literature Review on Large Language Models for Automated Program Repair
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
Towards Automated Crowdsourced Testing via Personified-LLM
by: Yu, Shengcheng, et al.
Published: (2026)
by: Yu, Shengcheng, et al.
Published: (2026)
A Survey on Large Language Models for Software Engineering
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
Static Code Analyzer Recommendation via Preference Mining
by: Ge, Xiuting, et al.
Published: (2024)
by: Ge, Xiuting, et al.
Published: (2024)
Log-based, Business-aware REST API Testing
by: Yang, Ding, et al.
Published: (2026)
by: Yang, Ding, et al.
Published: (2026)
Security of Language Models for Code: A Systematic Literature Review
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
CooTest: An Automated Testing Approach for V2X Communication Systems
by: Guo, An, et al.
Published: (2024)
by: Guo, An, et al.
Published: (2024)
GPU Temperature Simulation-Based Testing for In-Vehicle Deep Learning Frameworks
by: Zou, Yinglong, et al.
Published: (2025)
by: Zou, Yinglong, et al.
Published: (2025)
Scalpel: Automotive Deep Learning Framework Testing via Assembling Model Components
by: Zou, Yinglong, et al.
Published: (2025)
by: Zou, Yinglong, et al.
Published: (2025)
Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
TransformCode: A Contrastive Learning Framework for Code Embedding via Subtree Transformation
by: Xian, Zixiang, et al.
Published: (2023)
by: Xian, Zixiang, et al.
Published: (2023)
Practical, Automated Scenario-based Mobile App Testing
by: Yu, Shengcheng, et al.
Published: (2024)
by: Yu, Shengcheng, et al.
Published: (2024)
RUM: Rule+LLM-Based Comprehensive Assessment on Testing Skills
by: Wang, Yue, et al.
Published: (2025)
by: Wang, Yue, et al.
Published: (2025)
Effective, Platform-Independent GUI Testing via Image Embedding and Reinforcement Learning
by: Yu, Shengcheng, et al.
Published: (2022)
by: Yu, Shengcheng, et al.
Published: (2022)
Mutation-Based Deep Learning Framework Testing Method in JavaScript Environment
by: Zou, Yinglong, et al.
Published: (2024)
by: Zou, Yinglong, et al.
Published: (2024)
Deep Learning Framework Testing via Heuristic Guidance Based on Multiple Model Measurements
by: Zou, Yinglong, et al.
Published: (2025)
by: Zou, Yinglong, et al.
Published: (2025)
Improving Deep Assertion Generation via Fine-Tuning Retrieval-Augmented Pre-trained Language Models
by: Zhang, Quanjun, et al.
Published: (2025)
by: Zhang, Quanjun, et al.
Published: (2025)
An Effective Approach to Embedding Source Code by Combining Large Language and Sentence Embedding Models
by: Xian, Zixiang, et al.
Published: (2024)
by: Xian, Zixiang, et al.
Published: (2024)
Improving Retrieval-Augmented Deep Assertion Generation via Joint Training
by: Zhang, Quanjun, et al.
Published: (2025)
by: Zhang, Quanjun, et al.
Published: (2025)
Similar Items
-
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026) -
ComPass: Contrastive Learning for Automated Patch Correctness Assessment in Program Repair
by: Zhang, Quanjun, et al.
Published: (2026) -
On the Effectiveness of Code Representation in Deep Learning-Based Automated Patch Correctness Assessment
by: Zhang, Quanjun, et al.
Published: (2026) -
EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution
by: Hu, Haichuan, et al.
Published: (2026) -
TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models
by: Zhang, Quanjun, et al.
Published: (2024)