A Code Comprehension Benchmark for Large Language Models for Code
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Havare, Jayant, Chaudhary, Saurav, Ramakrishnan, Ganesh, Maharajan, Kaushik, Tamilselvam, Srikanth |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lost in Transcription: How Speech-to-Text Errors Derail Code Understanding
par: Havare, Jayant, et autres
Publié: (2026)
par: Havare, Jayant, et autres
Publié: (2026)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
par: Kammakomati, Mehant, et autres
Publié: (2024)
par: Kammakomati, Mehant, et autres
Publié: (2024)
DocCGen: Document-based Controlled Code Generation
par: Pimparkhede, Sameer, et autres
Publié: (2024)
par: Pimparkhede, Sameer, et autres
Publié: (2024)
Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering
par: Maharaj, Kishan, et autres
Publié: (2026)
par: Maharaj, Kishan, et autres
Publié: (2026)
ETF: An Entity Tracing Framework for Hallucination Detection in Code Summaries
par: Maharaj, Kishan, et autres
Publié: (2024)
par: Maharaj, Kishan, et autres
Publié: (2024)
CodeVaani: A Multilingual, Voice-Based Code Learning Assistant
par: Havare, Jayant, et autres
Publié: (2025)
par: Havare, Jayant, et autres
Publié: (2025)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
Testing the Effect of Code Documentation on Large Language Model Code Understanding
par: Macke, William, et autres
Publié: (2024)
par: Macke, William, et autres
Publié: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models
par: Han, Hojae, et autres
Publié: (2024)
par: Han, Hojae, et autres
Publié: (2024)
Benchmarking LLM Code Generation for Audio Programming with Visual Dataflow Languages
par: Zhang, William, et autres
Publié: (2024)
par: Zhang, William, et autres
Publié: (2024)
A Survey on Large Language Models for Code Generation
par: Jiang, Juyong, et autres
Publié: (2024)
par: Jiang, Juyong, et autres
Publié: (2024)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
SemCoder: Training Code Language Models with Comprehensive Semantics Reasoning
par: Ding, Yangruibo, et autres
Publié: (2024)
par: Ding, Yangruibo, et autres
Publié: (2024)
IndustryCode: A Benchmark for Industry Code Generation
par: Zeng, Puyu, et autres
Publié: (2026)
par: Zeng, Puyu, et autres
Publié: (2026)
Analyzing the Performance of Large Language Models on Code Summarization
par: Haldar, Rajarshi, et autres
Publié: (2024)
par: Haldar, Rajarshi, et autres
Publié: (2024)
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases
par: Liu, Xiangyan, et autres
Publié: (2024)
par: Liu, Xiangyan, et autres
Publié: (2024)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
par: Zhao, Bingchen, et autres
Publié: (2026)
par: Zhao, Bingchen, et autres
Publié: (2026)
ICE-Score: Instructing Large Language Models to Evaluate Code
par: Zhuo, Terry Yue
Publié: (2023)
par: Zhuo, Terry Yue
Publié: (2023)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)
par: Yadavally, Aashish, et autres
Publié: (2025)
CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at Scale
par: Wang, Chenlong, et autres
Publié: (2025)
par: Wang, Chenlong, et autres
Publié: (2025)
Exploring Data-Efficient Adaptation of Large Language Models for Code Generation
par: Jiang, Xue, et autres
Publié: (2024)
par: Jiang, Xue, et autres
Publié: (2024)
Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models
par: Zhuo, Terry Yue, et autres
Publié: (2024)
par: Zhuo, Terry Yue, et autres
Publié: (2024)
Self-Explained Keywords Empower Large Language Models for Code Generation
par: Fan, Lishui, et autres
Publié: (2024)
par: Fan, Lishui, et autres
Publié: (2024)
Mitigating Gender Bias in Code Large Language Models via Model Editing
par: Qin, Zhanyue, et autres
Publié: (2024)
par: Qin, Zhanyue, et autres
Publié: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
par: Jiang, Hongchao, et autres
Publié: (2025)
par: Jiang, Hongchao, et autres
Publié: (2025)
VHDL-Eval: A Framework for Evaluating Large Language Models in VHDL Code Generation
par: Vijayaraghavan, Prashanth, et autres
Publié: (2024)
par: Vijayaraghavan, Prashanth, et autres
Publié: (2024)
Large Language Models (LLMs) for Source Code Analysis: applications, models and datasets
par: Jelodar, Hamed, et autres
Publié: (2025)
par: Jelodar, Hamed, et autres
Publié: (2025)
Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
par: Huang, Baizhou, et autres
Publié: (2023)
par: Huang, Baizhou, et autres
Publié: (2023)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
par: Han, Hojae, et autres
Publié: (2025)
par: Han, Hojae, et autres
Publié: (2025)
UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
From Critique to Clarity: A Pathway to Faithful and Personalized Code Explanations with Large Language Models
par: Xu, Zexing, et autres
Publié: (2024)
par: Xu, Zexing, et autres
Publié: (2024)
aiXcoder-7B: A Lightweight and Effective Large Language Model for Code Processing
par: Jiang, Siyuan, et autres
Publié: (2024)
par: Jiang, Siyuan, et autres
Publié: (2024)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
par: Zhuo, Terry Yue, et autres
Publié: (2024)
par: Zhuo, Terry Yue, et autres
Publié: (2024)
Code Readability in the Age of Large Language Models: An Industrial Case Study from Atlassian
par: Takerngsaksiri, Wannita, et autres
Publié: (2025)
par: Takerngsaksiri, Wannita, et autres
Publié: (2025)
WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning
par: Yu, Zhaojian, et autres
Publié: (2023)
par: Yu, Zhaojian, et autres
Publié: (2023)
Documents similaires
-
Lost in Transcription: How Speech-to-Text Errors Derail Code Understanding
par: Havare, Jayant, et autres
Publié: (2026) -
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
par: Kammakomati, Mehant, et autres
Publié: (2024) -
DocCGen: Document-based Controlled Code Generation
par: Pimparkhede, Sameer, et autres
Publié: (2024) -
Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering
par: Maharaj, Kishan, et autres
Publié: (2026) -
ETF: An Entity Tracing Framework for Hallucination Detection in Code Summaries
par: Maharaj, Kishan, et autres
Publié: (2024)