CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
Fuente:
arXiv
Guardado en:
| Autor principal: | Padwal, Vedant |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025)
por: Wang, Peiding, et al.
Publicado: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
por: Yin, Wenjing, et al.
Publicado: (2025)
por: Yin, Wenjing, et al.
Publicado: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025)
por: He, Yibo, et al.
Publicado: (2025)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
por: He, Mengliang, et al.
Publicado: (2025)
por: He, Mengliang, et al.
Publicado: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
por: Meaden, James, et al.
Publicado: (2025)
por: Meaden, James, et al.
Publicado: (2025)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
por: Gui, Ningxin, et al.
Publicado: (2025)
por: Gui, Ningxin, et al.
Publicado: (2025)
Assessing the Code Clone Detection Capability of Large Language Models
por: Zhang, Zixian, et al.
Publicado: (2024)
por: Zhang, Zixian, et al.
Publicado: (2024)
JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models
por: Cao, Jialun, et al.
Publicado: (2024)
por: Cao, Jialun, et al.
Publicado: (2024)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
por: Mächtle, Felix, et al.
Publicado: (2026)
por: Mächtle, Felix, et al.
Publicado: (2026)
An Empirical Study on Capability of Large Language Models in Understanding Code Semantics
por: Nguyen, Thu-Trang, et al.
Publicado: (2024)
por: Nguyen, Thu-Trang, et al.
Publicado: (2024)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
Evaluating Large Language Models for Code Review
por: Cihan, Umut, et al.
Publicado: (2025)
por: Cihan, Umut, et al.
Publicado: (2025)
A Code Comprehension Benchmark for Large Language Models for Code
por: Havare, Jayant, et al.
Publicado: (2025)
por: Havare, Jayant, et al.
Publicado: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
por: Xiong, Zhanhang, et al.
Publicado: (2025)
por: Xiong, Zhanhang, et al.
Publicado: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
por: Jiang, Nan, et al.
Publicado: (2024)
por: Jiang, Nan, et al.
Publicado: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2024)
por: Zheng, Jiasheng, et al.
Publicado: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
Analyzing Latent Concepts in Code Language Models
por: Sharma, Arushi, et al.
Publicado: (2025)
por: Sharma, Arushi, et al.
Publicado: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
DebugBench: Evaluating Debugging Capability of Large Language Models
por: Tian, Runchu, et al.
Publicado: (2024)
por: Tian, Runchu, et al.
Publicado: (2024)
Task Abstention for Large Language Models in Code Generation
por: Zhou, Yanke, et al.
Publicado: (2026)
por: Zhou, Yanke, et al.
Publicado: (2026)
Evaluation of the Code Generation Capabilities of ChatGPT 4: A Comparative Analysis in 19 Programming Languages
por: Gilbert, L. C.
Publicado: (2025)
por: Gilbert, L. C.
Publicado: (2025)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
por: Kim, Myeongsoo, et al.
Publicado: (2025)
por: Kim, Myeongsoo, et al.
Publicado: (2025)
UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index
por: Christakis, Nicholas, et al.
Publicado: (2025)
por: Christakis, Nicholas, et al.
Publicado: (2025)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
por: Velasco, Alejandro, et al.
Publicado: (2024)
por: Velasco, Alejandro, et al.
Publicado: (2024)
Personality-Guided Code Generation Using Large Language Models
por: Guo, Yaoqi, et al.
Publicado: (2024)
por: Guo, Yaoqi, et al.
Publicado: (2024)
Large Language Model Guided Self-Debugging Code Generation
por: Adnan, Muntasir, et al.
Publicado: (2025)
por: Adnan, Muntasir, et al.
Publicado: (2025)
Bugs in Large Language Models Generated Code: An Empirical Study
por: Tambon, Florian, et al.
Publicado: (2024)
por: Tambon, Florian, et al.
Publicado: (2024)
A Comparative Analysis of Large Language Models for Code Documentation Generation
por: Dvivedi, Shubhang Shekhar, et al.
Publicado: (2023)
por: Dvivedi, Shubhang Shekhar, et al.
Publicado: (2023)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
por: Li, Yikun, et al.
Publicado: (2026)
por: Li, Yikun, et al.
Publicado: (2026)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
por: Macedo, Marcos, et al.
Publicado: (2024)
por: Macedo, Marcos, et al.
Publicado: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024)
por: Agarwal, Vibhor, et al.
Publicado: (2024)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
por: Cui, Yi
Publicado: (2024)
por: Cui, Yi
Publicado: (2024)
Eliciting Instruction-tuned Code Language Models' Capabilities to Utilize Auxiliary Function for Code Generation
por: Lee, Seonghyeon, et al.
Publicado: (2024)
por: Lee, Seonghyeon, et al.
Publicado: (2024)
ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation
por: Xiang, Jiahui, et al.
Publicado: (2025)
por: Xiang, Jiahui, et al.
Publicado: (2025)
Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming
por: Ashraf, Humza, et al.
Publicado: (2025)
por: Ashraf, Humza, et al.
Publicado: (2025)
Combining Large Language Models with Static Analyzers for Code Review Generation
por: Jaoua, Imen, et al.
Publicado: (2025)
por: Jaoua, Imen, et al.
Publicado: (2025)
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
por: Jin, Haolin, et al.
Publicado: (2025)
por: Jin, Haolin, et al.
Publicado: (2025)
Ejemplares similares
-
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025) -
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
por: Yin, Wenjing, et al.
Publicado: (2025) -
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025) -
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
por: He, Mengliang, et al.
Publicado: (2025) -
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)