Benchmarking and Revisiting Code Generation Assessment: A Mutation-Based Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Longtian, Li, Tianlin, Xie, Xiaofei, Zhi, Yuhan, Wang, Jian, Shen, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Teaching Code LLMs to Use Autocompletion Tools in Repository-Level Code Generation
par: Wang, Chong, et autres
Publié: (2024)
par: Wang, Chong, et autres
Publié: (2024)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
par: Wang, Kaixin, et autres
Publié: (2025)
par: Wang, Kaixin, et autres
Publié: (2025)
The Foundation Cracks: A Comprehensive Study on Bugs and Testing Practices in LLM Libraries
par: Jiang, Weipeng, et autres
Publié: (2025)
par: Jiang, Weipeng, et autres
Publié: (2025)
Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
par: Xiong, Qian, et autres
Publié: (2025)
par: Xiong, Qian, et autres
Publié: (2025)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
par: Yu, Hao, et autres
Publié: (2023)
par: Yu, Hao, et autres
Publié: (2023)
Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework
par: Wang, Chong, et autres
Publié: (2024)
par: Wang, Chong, et autres
Publié: (2024)
VulStamp: Vulnerability Assessment using Large Language Model
par: Shen, Hao, et autres
Publié: (2025)
par: Shen, Hao, et autres
Publié: (2025)
Ensemble-Based Uncertainty Estimation for Code Correctness Estimation
par: Wei, Yunxiang, et autres
Publié: (2026)
par: Wei, Yunxiang, et autres
Publié: (2026)
Rethinking Technology Stack Selection with AI Coding Proficiency
par: Zhang, Xiaoyu, et autres
Publié: (2025)
par: Zhang, Xiaoyu, et autres
Publié: (2025)
CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
par: Wang, Kaixin, et autres
Publié: (2025)
par: Wang, Kaixin, et autres
Publié: (2025)
Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
FT2Ra: A Fine-Tuning-Inspired Approach to Retrieval-Augmented Code Completion
par: Guo, Qi, et autres
Publié: (2024)
par: Guo, Qi, et autres
Publié: (2024)
Automated Vulnerability Injection in Solidity Smart Contracts: A Mutation-Based Approach for Benchmark Development
par: Iuliano, Gerardo, et autres
Publié: (2025)
par: Iuliano, Gerardo, et autres
Publié: (2025)
COFFE: A Code Efficiency Benchmark for Code Generation
par: Peng, Yun, et autres
Publié: (2025)
par: Peng, Yun, et autres
Publié: (2025)
Search-Induced Issues in Web-Augmented LLM Code Generation: Detecting and Repairing Error-Inducing Pages
par: Wang, Guoqing, et autres
Publié: (2026)
par: Wang, Guoqing, et autres
Publié: (2026)
Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement
par: Kong, Jiaolong, et autres
Publié: (2025)
par: Kong, Jiaolong, et autres
Publié: (2025)
GramTrans: A Better Code Representation Approach in Code Generation
par: Zhang, Zhao, et autres
Publié: (2025)
par: Zhang, Zhao, et autres
Publié: (2025)
GenCode: A Generic Data Augmentation Framework for Boosting Deep Learning-Based Code Understanding
par: Dong, Zeming, et autres
Publié: (2024)
par: Dong, Zeming, et autres
Publié: (2024)
TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems
par: Wang, Minxing, et autres
Publié: (2026)
par: Wang, Minxing, et autres
Publié: (2026)
A Systematic Literature Review on Neural Code Translation
par: Chen, Xiang, et autres
Publié: (2025)
par: Chen, Xiang, et autres
Publié: (2025)
LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation
par: Kuhar, Sachit, et autres
Publié: (2024)
par: Kuhar, Sachit, et autres
Publié: (2024)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
Deep Assessment of Code Review Generation Approaches: Beyond Lexical Similarity
par: Jiang, Yanjie, et autres
Publié: (2025)
par: Jiang, Yanjie, et autres
Publié: (2025)
Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
par: Pan, Zhiyuan, et autres
Publié: (2025)
par: Pan, Zhiyuan, et autres
Publié: (2025)
Generator-Based Fuzzers with Type-Based Targeted Mutation
par: Hussein, Soha, et autres
Publié: (2024)
par: Hussein, Soha, et autres
Publié: (2024)
PatchFuzz: Patch Fuzzing for JavaScript Engines
par: Wang, Junjie, et autres
Publié: (2025)
par: Wang, Junjie, et autres
Publié: (2025)
Boosting LLMs for Mutation Generation
par: Wang, Bo, et autres
Publié: (2026)
par: Wang, Bo, et autres
Publié: (2026)
CodeScore: Evaluating Code Generation by Learning Code Execution
par: Dong, Yihong, et autres
Publié: (2023)
par: Dong, Yihong, et autres
Publié: (2023)
Revisiting Code Search in a Two-Stage Paradigm
par: Hu, Fan, et autres
Publié: (2022)
par: Hu, Fan, et autres
Publié: (2022)
Generating Equivalent Representations of Code By A Self-Reflection Approach
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis
par: Wang, Longtian, et autres
Publié: (2025)
par: Wang, Longtian, et autres
Publié: (2025)
Benchmarking and Studying the LLM-based Code Review
par: Zeng, Zhengran, et autres
Publié: (2025)
par: Zeng, Zhengran, et autres
Publié: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Revisit Self-Debugging with Self-Generated Tests for Code Generation
par: Chen, Xiancai, et autres
Publié: (2025)
par: Chen, Xiancai, et autres
Publié: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
par: Guo, Xiaoyu, et autres
Publié: (2025)
par: Guo, Xiaoyu, et autres
Publié: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
par: Guo, Chengquan, et autres
Publié: (2024)
par: Guo, Chengquan, et autres
Publié: (2024)
CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation
par: Pan, Ruwei, et autres
Publié: (2025)
par: Pan, Ruwei, et autres
Publié: (2025)
Documents similaires
-
Teaching Code LLMs to Use Autocompletion Tools in Repository-Level Code Generation
par: Wang, Chong, et autres
Publié: (2024) -
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
par: Wang, Jian, et autres
Publié: (2025) -
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
par: Wang, Kaixin, et autres
Publié: (2025) -
The Foundation Cracks: A Comprehensive Study on Bugs and Testing Practices in LLM Libraries
par: Jiang, Weipeng, et autres
Publié: (2025) -
Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
par: Xiong, Qian, et autres
Publié: (2025)