An Empirical Study on Capability of Large Language Models in Understanding Code Semantics
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Thu-Trang, Vu, Thanh Trong, Vo, Hieu Dinh, Nguyen, Son |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
by: Bui, Tuan-Dung, et al.
Published: (2025)
by: Bui, Tuan-Dung, et al.
Published: (2025)
Model-Agnostic Correctness Assessment for LLM-Generated Code via Dynamic Internal Representation Selection
by: Vu, Thanh Trong, et al.
Published: (2025)
by: Vu, Thanh Trong, et al.
Published: (2025)
CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models
by: Pham, Tung-Thuy, et al.
Published: (2025)
by: Pham, Tung-Thuy, et al.
Published: (2025)
Automated Description Generation for Software Patches
by: Vu, Thanh Trong, et al.
Published: (2024)
by: Vu, Thanh Trong, et al.
Published: (2024)
Generating Critical Scenarios for Testing Automated Driving Systems
by: Nguyen, Trung-Hieu, et al.
Published: (2024)
by: Nguyen, Trung-Hieu, et al.
Published: (2024)
An Empirical Study on Self-correcting Large Language Models for Data Science Code Generation
by: Quoc, Thai Tang, et al.
Published: (2024)
by: Quoc, Thai Tang, et al.
Published: (2024)
iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML
by: Le, Dat, et al.
Published: (2026)
by: Le, Dat, et al.
Published: (2026)
RAMBO: Enhancing RAG-based Repository-Level Method Body Completion
by: Bui, Tuan-Dung, et al.
Published: (2024)
by: Bui, Tuan-Dung, et al.
Published: (2024)
Bugs in Large Language Models Generated Code: An Empirical Study
by: Tambon, Florian, et al.
Published: (2024)
by: Tambon, Florian, et al.
Published: (2024)
Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?
by: Orvalho, Pedro, et al.
Published: (2025)
by: Orvalho, Pedro, et al.
Published: (2025)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
by: Li, Chengze, et al.
Published: (2025)
by: Li, Chengze, et al.
Published: (2025)
Assessing the Code Clone Detection Capability of Large Language Models
by: Zhang, Zixian, et al.
Published: (2024)
by: Zhang, Zixian, et al.
Published: (2024)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
by: Wang, Ruiqi, et al.
Published: (2025)
by: Wang, Ruiqi, et al.
Published: (2025)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
by: Mächtle, Felix, et al.
Published: (2026)
by: Mächtle, Felix, et al.
Published: (2026)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
by: Gui, Ningxin, et al.
Published: (2025)
by: Gui, Ningxin, et al.
Published: (2025)
Empirical Studies of Parameter Efficient Methods for Large Language Models of Code and Knowledge Transfer to R
by: Esmaeili, Amirreza, et al.
Published: (2024)
by: Esmaeili, Amirreza, et al.
Published: (2024)
Reinforcement Learning-Based REST API Testing with Multi-Coverage
by: Nguyen, Tien-Quang, et al.
Published: (2024)
by: Nguyen, Tien-Quang, et al.
Published: (2024)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
On the Compression of Language Models for Code: An Empirical Study on CodeBERT
by: d'Aloisio, Giordano, et al.
Published: (2024)
by: d'Aloisio, Giordano, et al.
Published: (2024)
Memory-Efficient Large Language Models for Program Repair with Semantic-Guided Patch Generation
by: Le-Cong, Thanh, et al.
Published: (2024)
by: Le-Cong, Thanh, et al.
Published: (2024)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
by: Padwal, Vedant
Published: (2026)
by: Padwal, Vedant
Published: (2026)
Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories
by: Majgaonkar, Oorja, et al.
Published: (2025)
by: Majgaonkar, Oorja, et al.
Published: (2025)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
SpareCodeSearch: Searching for Code Context When You Have No Spare GPU
by: Nguyen, Minh
Published: (2025)
by: Nguyen, Minh
Published: (2025)
Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs
by: Le, Nguyen-Khang, et al.
Published: (2025)
by: Le, Nguyen-Khang, et al.
Published: (2025)
Empirical Study of Code Large Language Models for Binary Security Patch Detection
by: Li, Qingyuan, et al.
Published: (2025)
by: Li, Qingyuan, et al.
Published: (2025)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
by: Yadavally, Aashish, et al.
Published: (2025)
by: Yadavally, Aashish, et al.
Published: (2025)
A Gray Literature Study on Fairness Requirements in AI-enabled Software Engineering
by: Nguyen, Thanh, et al.
Published: (2025)
by: Nguyen, Thanh, et al.
Published: (2025)
Mastering the Craft of Data Synthesis for CodeLLMs
by: Chen, Meng, et al.
Published: (2024)
by: Chen, Meng, et al.
Published: (2024)
Tracking Software Security Topics
by: Vu, Phong Minh, et al.
Published: (2024)
by: Vu, Phong Minh, et al.
Published: (2024)
Mutation-based Consistency Testing for Evaluating the Code Understanding Capability of LLMs
by: Li, Ziyu, et al.
Published: (2024)
by: Li, Ziyu, et al.
Published: (2024)
Understanding Defects in Generated Codes by Language Models
by: Esfahani, Ali Mohammadi, et al.
Published: (2024)
by: Esfahani, Ali Mohammadi, et al.
Published: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
Testing the Effect of Code Documentation on Large Language Model Code Understanding
by: Macke, William, et al.
Published: (2024)
by: Macke, William, et al.
Published: (2024)
Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
by: Nguyen, Linh, et al.
Published: (2025)
by: Nguyen, Linh, et al.
Published: (2025)
RepoHyper: Search-Expand-Refine on Semantic Graphs for Repository-Level Code Completion
by: Phan, Huy N., et al.
Published: (2024)
by: Phan, Huy N., et al.
Published: (2024)
Behavioral Augmentation of UML Class Diagrams: An Empirical Study of Large Language Models for Method Generation
by: Rouabhia, Djaber, et al.
Published: (2025)
by: Rouabhia, Djaber, et al.
Published: (2025)
Leveraging LLMs for Multi-File DSL Code Generation: An Industrial Case Study
by: Chand, Sivajeet, et al.
Published: (2026)
by: Chand, Sivajeet, et al.
Published: (2026)
Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback
by: Wallraven, Stephan, et al.
Published: (2026)
by: Wallraven, Stephan, et al.
Published: (2026)
An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code Generation
by: Gandhi, Shubham, et al.
Published: (2025)
by: Gandhi, Shubham, et al.
Published: (2025)
Similar Items
-
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
by: Bui, Tuan-Dung, et al.
Published: (2025) -
Model-Agnostic Correctness Assessment for LLM-Generated Code via Dynamic Internal Representation Selection
by: Vu, Thanh Trong, et al.
Published: (2025) -
CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models
by: Pham, Tung-Thuy, et al.
Published: (2025) -
Automated Description Generation for Software Patches
by: Vu, Thanh Trong, et al.
Published: (2024) -
Generating Critical Scenarios for Testing Automated Driving Systems
by: Nguyen, Trung-Hieu, et al.
Published: (2024)