A Survey on Evaluating Large Language Models in Code Generation Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Liguo, Guo, Qi, Jia, Hongrui, Zeng, Zhengran, Wang, Xin, Xu, Yijiang, Wu, Jian, Wang, Yidong, Gao, Qing, Wang, Jindong, Ye, Wei, Zhang, Shikun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ISC4DGF: Enhancing Directed Grey-box Fuzzing with LLM-Driven Initial Seed Corpus Generation
di: Xu, Yijiang, et al.
Pubblicazione: (2024)
di: Xu, Yijiang, et al.
Pubblicazione: (2024)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models
di: Xing, Chengli, et al.
Pubblicazione: (2026)
di: Xing, Chengli, et al.
Pubblicazione: (2026)
Benchmarking and Studying the LLM-based Code Review
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
CodeShell Technical Report
di: Xie, Rui, et al.
Pubblicazione: (2024)
di: Xie, Rui, et al.
Pubblicazione: (2024)
Seed&Steer: Guiding Large Language Models with Compilable Prefix and Branch Signals for Unit Test Generation
di: Zhou, Shuaiyu, et al.
Pubblicazione: (2025)
di: Zhou, Shuaiyu, et al.
Pubblicazione: (2025)
CoderUJB: An Executable and Unified Java Benchmark for Practical Programming Scenarios
di: Zeng, Zhengran, et al.
Pubblicazione: (2024)
di: Zeng, Zhengran, et al.
Pubblicazione: (2024)
Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
di: Zeng, Zhengran, et al.
Pubblicazione: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
di: Feng, Jia, et al.
Pubblicazione: (2024)
di: Feng, Jia, et al.
Pubblicazione: (2024)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
di: Dai, Dekun, et al.
Pubblicazione: (2025)
di: Dai, Dekun, et al.
Pubblicazione: (2025)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
A Survey of Large Language Models for Code: Evolution, Benchmarking, and Future Trends
di: Zheng, Zibin, et al.
Pubblicazione: (2023)
di: Zheng, Zibin, et al.
Pubblicazione: (2023)
Software Testing with Large Language Models: Survey, Landscape, and Vision
di: Wang, Junjie, et al.
Pubblicazione: (2023)
di: Wang, Junjie, et al.
Pubblicazione: (2023)
Detecting the Root Cause Code Lines in Bug-Fixing Commits by Heterogeneous Graph Learning
di: Ji, Liguo, et al.
Pubblicazione: (2025)
di: Ji, Liguo, et al.
Pubblicazione: (2025)
Instructive Code Retriever: Learn from Large Language Model's Feedback for Code Intelligence Tasks
di: Lu, Jiawei, et al.
Pubblicazione: (2024)
di: Lu, Jiawei, et al.
Pubblicazione: (2024)
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
What Makes Good In-context Demonstrations for Code Intelligence Tasks with LLMs?
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
di: Guo, Xiaoyu, et al.
Pubblicazione: (2025)
di: Guo, Xiaoyu, et al.
Pubblicazione: (2025)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
di: Das, Gunjan, et al.
Pubblicazione: (2025)
di: Das, Gunjan, et al.
Pubblicazione: (2025)
Towards an Understanding of Large Language Models in Software Engineering Tasks
di: Zheng, Zibin, et al.
Pubblicazione: (2023)
di: Zheng, Zibin, et al.
Pubblicazione: (2023)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
di: Xue, Zhantong, et al.
Pubblicazione: (2025)
di: Xue, Zhantong, et al.
Pubblicazione: (2025)
ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation
di: Xiang, Jiahui, et al.
Pubblicazione: (2025)
di: Xiang, Jiahui, et al.
Pubblicazione: (2025)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
di: Xue, Pengyu, et al.
Pubblicazione: (2024)
di: Xue, Pengyu, et al.
Pubblicazione: (2024)
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
di: He, Pengfei, et al.
Pubblicazione: (2024)
di: He, Pengfei, et al.
Pubblicazione: (2024)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
di: Hu, Xing, et al.
Pubblicazione: (2025)
di: Hu, Xing, et al.
Pubblicazione: (2025)
Can Large Language Models Serve as Evaluators for Code Summarization?
di: Wu, Yang, et al.
Pubblicazione: (2024)
di: Wu, Yang, et al.
Pubblicazione: (2024)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
di: Liu, Jingjing, et al.
Pubblicazione: (2025)
di: Liu, Jingjing, et al.
Pubblicazione: (2025)
Cogito, ergo sum: A Neurobiologically-Inspired Cognition-Memory-Growth System for Code Generation
di: Li, Yanlong, et al.
Pubblicazione: (2025)
di: Li, Yanlong, et al.
Pubblicazione: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
di: Xiong, Zhanhang, et al.
Pubblicazione: (2025)
di: Xiong, Zhanhang, et al.
Pubblicazione: (2025)
On the Evaluation of Large Language Models in Unit Test Generation
di: Yang, Lin, et al.
Pubblicazione: (2024)
di: Yang, Lin, et al.
Pubblicazione: (2024)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
di: Ma, Lezhi, et al.
Pubblicazione: (2024)
di: Ma, Lezhi, et al.
Pubblicazione: (2024)
Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation
di: Sun, Zhihong, et al.
Pubblicazione: (2025)
di: Sun, Zhihong, et al.
Pubblicazione: (2025)
A Preliminary Study on the Robustness of Code Generation by Large Language Models
di: Li, Zike, et al.
Pubblicazione: (2025)
di: Li, Zike, et al.
Pubblicazione: (2025)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
Efficient Code Analysis via Graph-Guided Large Language Models
di: Gao, Hang, et al.
Pubblicazione: (2026)
di: Gao, Hang, et al.
Pubblicazione: (2026)
CodeMorph: Mitigating Data Leakage in Large Language Model Assessment
di: Rao, Hongzhou, et al.
Pubblicazione: (2025)
di: Rao, Hongzhou, et al.
Pubblicazione: (2025)
A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era
di: Khan, Taufiqul Islam, et al.
Pubblicazione: (2026)
di: Khan, Taufiqul Islam, et al.
Pubblicazione: (2026)
LLMs Meet Library Evolution: Evaluating Deprecated API Usage in LLM-based Code Completion
di: Wang, Chong, et al.
Pubblicazione: (2024)
di: Wang, Chong, et al.
Pubblicazione: (2024)
A Survey on Large Language Models for Code Generation
di: Jiang, Juyong, et al.
Pubblicazione: (2024)
di: Jiang, Juyong, et al.
Pubblicazione: (2024)
Language Models for Code Optimization: Survey, Challenges and Future Directions
di: Gong, Jingzhi, et al.
Pubblicazione: (2025)
di: Gong, Jingzhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ISC4DGF: Enhancing Directed Grey-box Fuzzing with LLM-Driven Initial Seed Corpus Generation
di: Xu, Yijiang, et al.
Pubblicazione: (2024) -
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024) -
An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models
di: Xing, Chengli, et al.
Pubblicazione: (2026) -
Benchmarking and Studying the LLM-based Code Review
di: Zeng, Zhengran, et al.
Pubblicazione: (2025) -
CodeShell Technical Report
di: Xie, Rui, et al.
Pubblicazione: (2024)