Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Mächtle, Felix, Serr, Jan-Niclas, Loose, Nils, Eisenbarth, Thomas |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AutoStub: Genetic Programming-Based Stub Creation for Symbolic Execution
by: Mächtle, Felix, et al.
Published: (2025)
by: Mächtle, Felix, et al.
Published: (2025)
OCEAN: Open-World Contrastive Authorship Identification
by: Mächtle, Felix, et al.
Published: (2024)
by: Mächtle, Felix, et al.
Published: (2024)
Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study
by: Loose, Nils, et al.
Published: (2026)
by: Loose, Nils, et al.
Published: (2026)
Trace Gadgets: Minimizing Code Context for Machine Learning-Based Vulnerability Prediction
by: Mächtle, Felix, et al.
Published: (2025)
by: Mächtle, Felix, et al.
Published: (2025)
Coverage-Guided Multi-Agent Harness Generation for Java Library Fuzzing
by: Loose, Nils, et al.
Published: (2026)
by: Loose, Nils, et al.
Published: (2026)
Assessing the Code Clone Detection Capability of Large Language Models
by: Zhang, Zixian, et al.
Published: (2024)
by: Zhang, Zixian, et al.
Published: (2024)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
by: Gui, Ningxin, et al.
Published: (2025)
by: Gui, Ningxin, et al.
Published: (2025)
An Empirical Study on Capability of Large Language Models in Understanding Code Semantics
by: Nguyen, Thu-Trang, et al.
Published: (2024)
by: Nguyen, Thu-Trang, et al.
Published: (2024)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
by: Padwal, Vedant
Published: (2026)
by: Padwal, Vedant
Published: (2026)
Beyond Summaries: Structure-Aware Labeling of Code Changes with Large Language Models
by: Weiss, Bar, et al.
Published: (2026)
by: Weiss, Bar, et al.
Published: (2026)
Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
by: Li, Chengze, et al.
Published: (2025)
by: Li, Chengze, et al.
Published: (2025)
A Code Comprehension Benchmark for Large Language Models for Code
by: Havare, Jayant, et al.
Published: (2025)
by: Havare, Jayant, et al.
Published: (2025)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar
by: Zhang, Yuanliang, et al.
Published: (2024)
by: Zhang, Yuanliang, et al.
Published: (2024)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
by: Yin, Wenjing, et al.
Published: (2025)
by: Yin, Wenjing, et al.
Published: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
by: Chen, Simin, et al.
Published: (2025)
by: Chen, Simin, et al.
Published: (2025)
Evaluating Large Language Models for Code Review
by: Cihan, Umut, et al.
Published: (2025)
by: Cihan, Umut, et al.
Published: (2025)
Enhancing the Capabilities of Large Language Models for API calls through Knowledge Graphs
by: Yang, Ye, et al.
Published: (2025)
by: Yang, Ye, et al.
Published: (2025)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
by: Guo, Jiawei, et al.
Published: (2024)
by: Guo, Jiawei, et al.
Published: (2024)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
Augmenting Large Language Models with Static Code Analysis for Automated Code Quality Improvements
by: Abtahi, Seyed Moein, et al.
Published: (2025)
by: Abtahi, Seyed Moein, et al.
Published: (2025)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Personality-Guided Code Generation Using Large Language Models
by: Guo, Yaoqi, et al.
Published: (2024)
by: Guo, Yaoqi, et al.
Published: (2024)
Large Language Model Guided Self-Debugging Code Generation
by: Adnan, Muntasir, et al.
Published: (2025)
by: Adnan, Muntasir, et al.
Published: (2025)
Bugs in Large Language Models Generated Code: An Empirical Study
by: Tambon, Florian, et al.
Published: (2024)
by: Tambon, Florian, et al.
Published: (2024)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
by: Wu, Yixi, et al.
Published: (2024)
by: Wu, Yixi, et al.
Published: (2024)
Towards Leveraging Large Language Model Summaries for Topic Modeling in Source Code
by: Carissimi, Michele, et al.
Published: (2025)
by: Carissimi, Michele, et al.
Published: (2025)
Large Language Model-Driven Code Compliance Checking in Building Information Modeling
by: Madireddy, Soumya, et al.
Published: (2025)
by: Madireddy, Soumya, et al.
Published: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
by: Xiong, Zhanhang, et al.
Published: (2025)
by: Xiong, Zhanhang, et al.
Published: (2025)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026)
by: Li, Yuangang, et al.
Published: (2026)
Large Language Models in Code Co-generation for Safe Autonomous Vehicles
by: Nouri, Ali, et al.
Published: (2025)
by: Nouri, Ali, et al.
Published: (2025)
Combining Large Language Models with Static Analyzers for Code Review Generation
by: Jaoua, Imen, et al.
Published: (2025)
by: Jaoua, Imen, et al.
Published: (2025)
A Comparative Analysis of Large Language Models for Code Documentation Generation
by: Dvivedi, Shubhang Shekhar, et al.
Published: (2023)
by: Dvivedi, Shubhang Shekhar, et al.
Published: (2023)
Automated Code Review Using Large Language Models with Symbolic Reasoning
by: Icoz, Busra, et al.
Published: (2025)
by: Icoz, Busra, et al.
Published: (2025)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
by: Macedo, Marcos, et al.
Published: (2024)
by: Macedo, Marcos, et al.
Published: (2024)
PerfCoder: Large Language Models for Interpretable Code Performance Optimization
by: Yang, Jiuding, et al.
Published: (2025)
by: Yang, Jiuding, et al.
Published: (2025)
Similar Items
-
AutoStub: Genetic Programming-Based Stub Creation for Symbolic Execution
by: Mächtle, Felix, et al.
Published: (2025) -
OCEAN: Open-World Contrastive Authorship Identification
by: Mächtle, Felix, et al.
Published: (2024) -
Code-Centric Detection of Vulnerability-Fixing Commits: A Unified Benchmark and Empirical Study
by: Loose, Nils, et al.
Published: (2026) -
Trace Gadgets: Minimizing Code Context for Machine Learning-Based Vulnerability Prediction
by: Mächtle, Felix, et al.
Published: (2025) -
Coverage-Guided Multi-Agent Harness Generation for Java Library Fuzzing
by: Loose, Nils, et al.
Published: (2026)