Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Changshu, Chen, Yang, Jabbarvand, Reyhaneh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
par: Liu, Changshu, et autres
Publié: (2025)
par: Liu, Changshu, et autres
Publié: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
par: Liu, Changshu, et autres
Publié: (2025)
par: Liu, Changshu, et autres
Publié: (2025)
Narrowing the Complexity Gap in the Evaluation of Large Language Models
par: Chen, Yang, et autres
Publié: (2026)
par: Chen, Yang, et autres
Publié: (2026)
A Generic Approach to Fix Test Flakiness in Real-World Projects
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Evaluating LLMs Code Reasoning Under Real-World Context
par: Liu, Changshu
Publié: (2026)
par: Liu, Changshu
Publié: (2026)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
par: Ibrahimzada, Ali Reza, et autres
Publié: (2026)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2026)
Can Old Tests Do New Tricks for Resolving SWE Issues?
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation
par: Chowdhury, Jaid Monwar, et autres
Publié: (2026)
par: Chowdhury, Jaid Monwar, et autres
Publié: (2026)
Challenging Bug Prediction and Repair Models with Synthetic Bugs
par: Ibrahimzada, Ali Reza, et autres
Publié: (2023)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2023)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
par: Ibrahimzada, Ali Reza, et autres
Publié: (2025)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2025)
Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code
par: Pan, Rangeet, et autres
Publié: (2023)
par: Pan, Rangeet, et autres
Publié: (2023)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
par: Yang, Chenyuan, et autres
Publié: (2023)
par: Yang, Chenyuan, et autres
Publié: (2023)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
par: Ke, Kaiyao, et autres
Publié: (2025)
par: Ke, Kaiyao, et autres
Publié: (2025)
Translating Large-Scale C Repositories to Idiomatic Rust
par: Dehghan, Saman, et autres
Publié: (2025)
par: Dehghan, Saman, et autres
Publié: (2025)
LeTI: Learning to Generate from Textual Interactions
par: Wang, Xingyao, et autres
Publié: (2023)
par: Wang, Xingyao, et autres
Publié: (2023)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
par: He, Minghua, et autres
Publié: (2025)
par: He, Minghua, et autres
Publié: (2025)
Evaluating Plan Compliance in Autonomous Programming Agents
par: Liu, Shuyang, et autres
Publié: (2026)
par: Liu, Shuyang, et autres
Publié: (2026)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
par: Ibrahimzada, Ali Reza, et autres
Publié: (2024)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2024)
VisualCoder: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought Reasoning
par: Le, Cuong Chi, et autres
Publié: (2024)
par: Le, Cuong Chi, et autres
Publié: (2024)
A Study on Thinking Patterns of Large Reasoning Models in Code Generation
par: Halim, Kevin, et autres
Publié: (2025)
par: Halim, Kevin, et autres
Publié: (2025)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
par: Li, Yikun, et autres
Publié: (2026)
par: Li, Yikun, et autres
Publié: (2026)
Automated Code Editing with Search-Generate-Modify
par: Liu, Changshu, et autres
Publié: (2023)
par: Liu, Changshu, et autres
Publié: (2023)
Can Large Language Models Solve Path Constraints in Symbolic Execution?
par: Wang, Wenhan, et autres
Publié: (2025)
par: Wang, Wenhan, et autres
Publié: (2025)
Hotfixing Large Language Models for Code
par: Yang, Zhou, et autres
Publié: (2024)
par: Yang, Zhou, et autres
Publié: (2024)
Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation
par: Abdollahi, Mohammad, et autres
Publié: (2025)
par: Abdollahi, Mohammad, et autres
Publié: (2025)
NExT: Teaching Large Language Models to Reason about Code Execution
par: Ni, Ansong, et autres
Publié: (2024)
par: Ni, Ansong, et autres
Publié: (2024)
Beyond Strict Rules: Assessing the Effectiveness of Large Language Models for Code Smell Detection
par: Souza, Saymon, et autres
Publié: (2026)
par: Souza, Saymon, et autres
Publié: (2026)
Ecosystem of Large Language Models for Code
par: Yang, Zhou, et autres
Publié: (2024)
par: Yang, Zhou, et autres
Publié: (2024)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Greening Large Language Models of Code
par: Shi, Jieke, et autres
Publié: (2023)
par: Shi, Jieke, et autres
Publié: (2023)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
par: Tang, Lingxiao, et autres
Publié: (2026)
par: Tang, Lingxiao, et autres
Publié: (2026)
Advancing Code Coverage: Incorporating Program Analysis with Large Language Models
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
Assessing the Code Clone Detection Capability of Large Language Models
par: Zhang, Zixian, et autres
Publié: (2024)
par: Zhang, Zixian, et autres
Publié: (2024)
DCE-LLM: Dead Code Elimination with Large Language Models
par: Chen, Minyu, et autres
Publié: (2025)
par: Chen, Minyu, et autres
Publié: (2025)
Compiling Code LLMs into Lightweight Executables
par: Shi, Jieke, et autres
Publié: (2026)
par: Shi, Jieke, et autres
Publié: (2026)
Adversarial Attack Classification and Robustness Testing for Large Language Models for Code
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Aligning Requirement for Large Language Model's Code Generation
par: Tian, Zhao, et autres
Publié: (2025)
par: Tian, Zhao, et autres
Publié: (2025)
Instructive Code Retriever: Learn from Large Language Model's Feedback for Code Intelligence Tasks
par: Lu, Jiawei, et autres
Publié: (2024)
par: Lu, Jiawei, et autres
Publié: (2024)
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation
par: Gui, Ningxin, et autres
Publié: (2025)
par: Gui, Ningxin, et autres
Publié: (2025)
Documents similaires
-
A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
par: Liu, Changshu, et autres
Publié: (2025) -
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024) -
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
par: Liu, Changshu, et autres
Publié: (2025) -
Narrowing the Complexity Gap in the Evaluation of Large Language Models
par: Chen, Yang, et autres
Publié: (2026) -
A Generic Approach to Fix Test Flakiness in Real-World Projects
par: Chen, Yang, et autres
Publié: (2024)