Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chenglin, Xu, Yisen, Wang, Zehao, Tan, Shin Hwei, Tse-Hsun, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
por: Xu, Yisen, et al.
Publicado: (2026)
por: Xu, Yisen, et al.
Publicado: (2026)
Automated Harmfulness Testing for Code Large Language Models
por: Tan, Honghao, et al.
Publicado: (2025)
por: Tan, Honghao, et al.
Publicado: (2025)
Guiding ChatGPT to Fix Web UI Tests via Explanation-Consistency Checking
por: Xu, Zhuolin, et al.
Publicado: (2023)
por: Xu, Zhuolin, et al.
Publicado: (2023)
Testing Refactoring Engine via Historical Bug Report driven LLM
por: Wang, Haibo, et al.
Publicado: (2025)
por: Wang, Haibo, et al.
Publicado: (2025)
What Makes Code Generation Ethically Sourced?
por: Xu, Zhuolin, et al.
Publicado: (2025)
por: Xu, Zhuolin, et al.
Publicado: (2025)
On Rank Aggregating Test Prioritizations
por: Mondal, Shouvick, et al.
Publicado: (2024)
por: Mondal, Shouvick, et al.
Publicado: (2024)
MANTRA: Enhancing Automated Method-Level Refactoring with Contextual RAG and Multi-Agent LLM Collaboration
por: Xu, Yisen, et al.
Publicado: (2025)
por: Xu, Yisen, et al.
Publicado: (2025)
Ethics Testing: Proactive Identification of Generative AI System Harms
por: Tan, Shin Hwei, et al.
Publicado: (2026)
por: Tan, Shin Hwei, et al.
Publicado: (2026)
LLM-Guided Issue Generation from Uncovered Code Segments
por: Pressato, Diany, et al.
Publicado: (2026)
por: Pressato, Diany, et al.
Publicado: (2026)
Identifying Performance-Sensitive Configurations in Software Systems through Code Analysis with LLM Agents
por: Wang, Zehao, et al.
Publicado: (2024)
por: Wang, Zehao, et al.
Publicado: (2024)
CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs
por: He, Pengfei, et al.
Publicado: (2025)
por: He, Pengfei, et al.
Publicado: (2025)
Structured Safety Auditing for Balancing Code Correctness and Content Safety in LLM-Generated Code
por: Tan, Honghao, et al.
Publicado: (2026)
por: Tan, Honghao, et al.
Publicado: (2026)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
por: Tse-Hsun, et al.
Publicado: (2026)
por: Tse-Hsun, et al.
Publicado: (2026)
Efficient Incremental Code Coverage Analysis for Regression Test Suites
por: Wang, Jiale Amber, et al.
Publicado: (2024)
por: Wang, Jiale Amber, et al.
Publicado: (2024)
Empowering AIOps: Leveraging Large Language Models for IT Operations Management
por: Vitui, Arthur, et al.
Publicado: (2025)
por: Vitui, Arthur, et al.
Publicado: (2025)
Investigating Code Reuse in Software Redesign: A Case Study
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
Dissecting Bug Triggers and Failure Modes in Modern Agentic Frameworks: An Empirical Study
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era
por: Khan, Taufiqul Islam, et al.
Publicado: (2026)
por: Khan, Taufiqul Islam, et al.
Publicado: (2026)
CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows
por: Muna, Rabeya Khatun, et al.
Publicado: (2026)
por: Muna, Rabeya Khatun, et al.
Publicado: (2026)
Screencast-Based Analysis of User-Perceived GUI Responsiveness
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
SLICET5: Static Program Slicing using Language Models with Copy Mechanism and Constrained Decoding
por: He, Pengfei, et al.
Publicado: (2025)
por: He, Pengfei, et al.
Publicado: (2025)
An Empirical Study of Refactoring Engine Bugs
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
Regression Test Suite for Payment Switch using jPOS
por: Sardesai, Atharv, et al.
Publicado: (2022)
por: Sardesai, Atharv, et al.
Publicado: (2022)
Studying the Impact of Early Test Termination Due to Assertion Failure on Code Coverage and Spectrum-based Fault Localization
por: Uddin, Md. Ashraf, et al.
Publicado: (2025)
por: Uddin, Md. Ashraf, et al.
Publicado: (2025)
MobileUPReg: Identifying User-Perceived Performance Regressions in Mobile OS Versions
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
Studying and Benchmarking Large Language Models For Log Level Suggestion
por: Heng, Yi Wen, et al.
Publicado: (2024)
por: Heng, Yi Wen, et al.
Publicado: (2024)
PopSweeper: Automatically Detecting and Resolving App-Blocking Pop-Ups to Assist Automated Mobile GUI Testing
por: Guo, Linqiang, et al.
Publicado: (2024)
por: Guo, Linqiang, et al.
Publicado: (2024)
Understanding and Detecting Annotation-Induced Faults of Static Analyzers
por: Zhang, Huaien, et al.
Publicado: (2024)
por: Zhang, Huaien, et al.
Publicado: (2024)
Mutation-Guided Unit Test Generation with a Large Language Model
por: Wang, Guancheng, et al.
Publicado: (2025)
por: Wang, Guancheng, et al.
Publicado: (2025)
Moving beyond Deletions: Program Simplification via Diverse Program Transformations
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests
por: Rafi, Md Nakhla, et al.
Publicado: (2024)
por: Rafi, Md Nakhla, et al.
Publicado: (2024)
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
por: He, Pengfei, et al.
Publicado: (2024)
por: He, Pengfei, et al.
Publicado: (2024)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
por: Zhu, Sicheng, et al.
Publicado: (2026)
por: Zhu, Sicheng, et al.
Publicado: (2026)
Back to the Future! Studying Data Cleanness in Defects4J and its Impact on Fault Localization
por: Rafi, Md Nakhla, et al.
Publicado: (2023)
por: Rafi, Md Nakhla, et al.
Publicado: (2023)
An Empirical Study on the Characteristics of Database Access Bugs in Java Applications
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
An Empirical Study of False Negatives and Positives of Static Code Analyzers From the Perspective of Historical Issues
por: Cui, Han, et al.
Publicado: (2024)
por: Cui, Han, et al.
Publicado: (2024)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
por: Wu, Yixi, et al.
Publicado: (2024)
por: Wu, Yixi, et al.
Publicado: (2024)
Towards a Fault-Injection Benchmarking Suite
por: Wang, Tianhao, et al.
Publicado: (2024)
por: Wang, Tianhao, et al.
Publicado: (2024)
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
por: Shafin, Wasique Islam, et al.
Publicado: (2025)
por: Shafin, Wasique Islam, et al.
Publicado: (2025)
Ejemplares similares
-
From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair
por: Li, Chenglin, et al.
Publicado: (2026) -
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
por: Xu, Yisen, et al.
Publicado: (2026) -
Automated Harmfulness Testing for Code Large Language Models
por: Tan, Honghao, et al.
Publicado: (2025) -
Guiding ChatGPT to Fix Web UI Tests via Explanation-Consistency Checking
por: Xu, Zhuolin, et al.
Publicado: (2023) -
Testing Refactoring Engine via Historical Bug Report driven LLM
por: Wang, Haibo, et al.
Publicado: (2025)