CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Brahman, Danny, Mahoor, Mohammad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation
por: Xue, Pengyu, et al.
Publicado: (2025)
por: Xue, Pengyu, et al.
Publicado: (2025)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
por: Xue, Pengyu, et al.
Publicado: (2024)
por: Xue, Pengyu, et al.
Publicado: (2024)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
por: Yu, Hao, et al.
Publicado: (2023)
por: Yu, Hao, et al.
Publicado: (2023)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
por: Peng, Zhiyuan, et al.
Publicado: (2025)
por: Peng, Zhiyuan, et al.
Publicado: (2025)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
por: Ma, Lezhi, et al.
Publicado: (2024)
por: Ma, Lezhi, et al.
Publicado: (2024)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
por: Feng, Jia, et al.
Publicado: (2024)
por: Feng, Jia, et al.
Publicado: (2024)
Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
por: Hamedi, Parisa, et al.
Publicado: (2025)
por: Hamedi, Parisa, et al.
Publicado: (2025)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
por: Dai, Dekun, et al.
Publicado: (2025)
por: Dai, Dekun, et al.
Publicado: (2025)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
por: Zhao, Yuwei, et al.
Publicado: (2024)
por: Zhao, Yuwei, et al.
Publicado: (2024)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
Measuring how changes in code readability attributes affect code quality evaluation by Large Language Models
por: Simoes, Igor Regis da Silva, et al.
Publicado: (2025)
por: Simoes, Igor Regis da Silva, et al.
Publicado: (2025)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
por: Tambon, Florian, et al.
Publicado: (2024)
por: Tambon, Florian, et al.
Publicado: (2024)
Natural Is The Best: Model-Agnostic Code Simplification for Pre-trained Large Language Models
por: Wang, Yan, et al.
Publicado: (2024)
por: Wang, Yan, et al.
Publicado: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
por: Kammakomati, Mehant, et al.
Publicado: (2024)
por: Kammakomati, Mehant, et al.
Publicado: (2024)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
por: Wang, Jiexin, et al.
Publicado: (2024)
por: Wang, Jiexin, et al.
Publicado: (2024)
Measuring Impacts of Poisoning on Model Parameters and Embeddings for Large Language Models of Code
por: Hussain, Aftab, et al.
Publicado: (2024)
por: Hussain, Aftab, et al.
Publicado: (2024)
Evaluating Large Language Models for Code Translation: Effects of Prompt Language and Prompt Design
por: Aljagthami, Aamer, et al.
Publicado: (2025)
por: Aljagthami, Aamer, et al.
Publicado: (2025)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
por: Yu, Zhaojian, et al.
Publicado: (2024)
por: Yu, Zhaojian, et al.
Publicado: (2024)
VHDL-Eval: A Framework for Evaluating Large Language Models in VHDL Code Generation
por: Vijayaraghavan, Prashanth, et al.
Publicado: (2024)
por: Vijayaraghavan, Prashanth, et al.
Publicado: (2024)
Code Membership Inference for Detecting Unauthorized Data Use in Code Pre-trained Language Models
por: Zhang, Sheng, et al.
Publicado: (2023)
por: Zhang, Sheng, et al.
Publicado: (2023)
Greening Large Language Models of Code
por: Shi, Jieke, et al.
Publicado: (2023)
por: Shi, Jieke, et al.
Publicado: (2023)
Hotfixing Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
Ecosystem of Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
Emotion Classification In Software Engineering Texts: A Comparative Analysis of Pre-trained Transformers Language Models
por: Imran, Mia Mohammad
Publicado: (2024)
por: Imran, Mia Mohammad
Publicado: (2024)
LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language Models
por: Wang, Yan, et al.
Publicado: (2025)
por: Wang, Yan, et al.
Publicado: (2025)
SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis
por: Li, Yansong, et al.
Publicado: (2025)
por: Li, Yansong, et al.
Publicado: (2025)
Bridge and Hint: Extending Pre-trained Language Models for Long-Range Code
por: Chen, Yujia, et al.
Publicado: (2024)
por: Chen, Yujia, et al.
Publicado: (2024)
Large Language Model Unlearning for Source Code
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
Improving the Ability of Pre-trained Language Model by Imparting Large Language Model's Experience
por: Yin, Xin, et al.
Publicado: (2024)
por: Yin, Xin, et al.
Publicado: (2024)
Exploring the Potential of Large Language Models in Self-adaptive Systems
por: Li, Jialong, et al.
Publicado: (2024)
por: Li, Jialong, et al.
Publicado: (2024)
Automated Harmfulness Testing for Code Large Language Models
por: Tan, Honghao, et al.
Publicado: (2025)
por: Tan, Honghao, et al.
Publicado: (2025)
Assertion Messages with Large Language Models (LLMs) for Code
por: Aljohani, Ahmed, et al.
Publicado: (2025)
por: Aljohani, Ahmed, et al.
Publicado: (2025)
Can Large Language Models Generate Geospatial Code?
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
Large Language Models for Code Generation: The Practitioners Perspective
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
Optimizing Large Language Model Hyperparameters for Code Generation
por: Arora, Chetan, et al.
Publicado: (2024)
por: Arora, Chetan, et al.
Publicado: (2024)
Aligning Requirement for Large Language Model's Code Generation
por: Tian, Zhao, et al.
Publicado: (2025)
por: Tian, Zhao, et al.
Publicado: (2025)
Self-planning Code Generation with Large Language Models
por: Jiang, Xue, et al.
Publicado: (2023)
por: Jiang, Xue, et al.
Publicado: (2023)
Harnessing Large Language Models for Curated Code Reviews
por: Sghaier, Oussama Ben, et al.
Publicado: (2025)
por: Sghaier, Oussama Ben, et al.
Publicado: (2025)
Impact of Large Language Models of Code on Fault Localization
por: Ji, Suhwan, et al.
Publicado: (2024)
por: Ji, Suhwan, et al.
Publicado: (2024)
A Hybrid Approach for EMF Code Generation:Code Templates Meet Large Language Models
por: He, Xiao, et al.
Publicado: (2025)
por: He, Xiao, et al.
Publicado: (2025)
Ejemplares similares
-
TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation
por: Xue, Pengyu, et al.
Publicado: (2025) -
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
por: Xue, Pengyu, et al.
Publicado: (2024) -
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
por: Yu, Hao, et al.
Publicado: (2023) -
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
por: Peng, Zhiyuan, et al.
Publicado: (2025) -
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
por: Ma, Lezhi, et al.
Publicado: (2024)