CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Padwal, Vedant |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
par: Wang, Peiding, et autres
Publié: (2025)
par: Wang, Peiding, et autres
Publié: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
par: Yin, Wenjing, et autres
Publié: (2025)
par: Yin, Wenjing, et autres
Publié: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
par: He, Yibo, et autres
Publié: (2025)
par: He, Yibo, et autres
Publié: (2025)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
par: He, Mengliang, et autres
Publié: (2025)
par: He, Mengliang, et autres
Publié: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
par: Meaden, James, et autres
Publié: (2025)
par: Meaden, James, et autres
Publié: (2025)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
par: Gui, Ningxin, et autres
Publié: (2025)
par: Gui, Ningxin, et autres
Publié: (2025)
Assessing the Code Clone Detection Capability of Large Language Models
par: Zhang, Zixian, et autres
Publié: (2024)
par: Zhang, Zixian, et autres
Publié: (2024)
JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models
par: Cao, Jialun, et autres
Publié: (2024)
par: Cao, Jialun, et autres
Publié: (2024)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
par: Mächtle, Felix, et autres
Publié: (2026)
par: Mächtle, Felix, et autres
Publié: (2026)
An Empirical Study on Capability of Large Language Models in Understanding Code Semantics
par: Nguyen, Thu-Trang, et autres
Publié: (2024)
par: Nguyen, Thu-Trang, et autres
Publié: (2024)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
par: Zhang, Tanghaoran, et autres
Publié: (2026)
par: Zhang, Tanghaoran, et autres
Publié: (2026)
Evaluating Large Language Models for Code Review
par: Cihan, Umut, et autres
Publié: (2025)
par: Cihan, Umut, et autres
Publié: (2025)
A Code Comprehension Benchmark for Large Language Models for Code
par: Havare, Jayant, et autres
Publié: (2025)
par: Havare, Jayant, et autres
Publié: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
par: Xiong, Zhanhang, et autres
Publié: (2025)
par: Xiong, Zhanhang, et autres
Publié: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
Analyzing Latent Concepts in Code Language Models
par: Sharma, Arushi, et autres
Publié: (2025)
par: Sharma, Arushi, et autres
Publié: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
DebugBench: Evaluating Debugging Capability of Large Language Models
par: Tian, Runchu, et autres
Publié: (2024)
par: Tian, Runchu, et autres
Publié: (2024)
Task Abstention for Large Language Models in Code Generation
par: Zhou, Yanke, et autres
Publié: (2026)
par: Zhou, Yanke, et autres
Publié: (2026)
Evaluation of the Code Generation Capabilities of ChatGPT 4: A Comparative Analysis in 19 Programming Languages
par: Gilbert, L. C.
Publié: (2025)
par: Gilbert, L. C.
Publié: (2025)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
par: Kim, Myeongsoo, et autres
Publié: (2025)
par: Kim, Myeongsoo, et autres
Publié: (2025)
UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index
par: Christakis, Nicholas, et autres
Publié: (2025)
par: Christakis, Nicholas, et autres
Publié: (2025)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
par: Velasco, Alejandro, et autres
Publié: (2024)
par: Velasco, Alejandro, et autres
Publié: (2024)
Personality-Guided Code Generation Using Large Language Models
par: Guo, Yaoqi, et autres
Publié: (2024)
par: Guo, Yaoqi, et autres
Publié: (2024)
Large Language Model Guided Self-Debugging Code Generation
par: Adnan, Muntasir, et autres
Publié: (2025)
par: Adnan, Muntasir, et autres
Publié: (2025)
Bugs in Large Language Models Generated Code: An Empirical Study
par: Tambon, Florian, et autres
Publié: (2024)
par: Tambon, Florian, et autres
Publié: (2024)
A Comparative Analysis of Large Language Models for Code Documentation Generation
par: Dvivedi, Shubhang Shekhar, et autres
Publié: (2023)
par: Dvivedi, Shubhang Shekhar, et autres
Publié: (2023)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
par: Li, Yikun, et autres
Publié: (2026)
par: Li, Yikun, et autres
Publié: (2026)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
par: Macedo, Marcos, et autres
Publié: (2024)
par: Macedo, Marcos, et autres
Publié: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
Eliciting Instruction-tuned Code Language Models' Capabilities to Utilize Auxiliary Function for Code Generation
par: Lee, Seonghyeon, et autres
Publié: (2024)
par: Lee, Seonghyeon, et autres
Publié: (2024)
ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation
par: Xiang, Jiahui, et autres
Publié: (2025)
par: Xiang, Jiahui, et autres
Publié: (2025)
Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming
par: Ashraf, Humza, et autres
Publié: (2025)
par: Ashraf, Humza, et autres
Publié: (2025)
Combining Large Language Models with Static Analyzers for Code Review Generation
par: Jaoua, Imen, et autres
Publié: (2025)
par: Jaoua, Imen, et autres
Publié: (2025)
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
par: Jin, Haolin, et autres
Publié: (2025)
par: Jin, Haolin, et autres
Publié: (2025)
Documents similaires
-
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
par: Wang, Peiding, et autres
Publié: (2025) -
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
par: Yin, Wenjing, et autres
Publié: (2025) -
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
par: He, Yibo, et autres
Publié: (2025) -
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
par: He, Mengliang, et autres
Publié: (2025) -
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)