A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Changshu, Jabbarvand, Reyhaneh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
Narrowing the Complexity Gap in the Evaluation of Large Language Models
por: Chen, Yang, et al.
Publicado: (2026)
por: Chen, Yang, et al.
Publicado: (2026)
Evaluating LLMs Code Reasoning Under Real-World Context
por: Liu, Changshu
Publicado: (2026)
por: Liu, Changshu
Publicado: (2026)
A Generic Approach to Fix Test Flakiness in Real-World Projects
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2026)
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2026)
SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation
por: Chowdhury, Jaid Monwar, et al.
Publicado: (2026)
por: Chowdhury, Jaid Monwar, et al.
Publicado: (2026)
Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code
por: Pan, Rangeet, et al.
Publicado: (2023)
por: Pan, Rangeet, et al.
Publicado: (2023)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2025)
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2025)
Can Old Tests Do New Tricks for Resolving SWE Issues?
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Advancing Automated In-Isolation Validation in Repository-Level Code Translation
por: Ke, Kaiyao, et al.
Publicado: (2025)
por: Ke, Kaiyao, et al.
Publicado: (2025)
Translating Large-Scale C Repositories to Idiomatic Rust
por: Dehghan, Saman, et al.
Publicado: (2025)
por: Dehghan, Saman, et al.
Publicado: (2025)
Challenging Bug Prediction and Repair Models with Synthetic Bugs
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2023)
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2023)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
por: Yang, Chenyuan, et al.
Publicado: (2023)
por: Yang, Chenyuan, et al.
Publicado: (2023)
LeTI: Learning to Generate from Textual Interactions
por: Wang, Xingyao, et al.
Publicado: (2023)
por: Wang, Xingyao, et al.
Publicado: (2023)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2024)
por: Ibrahimzada, Ali Reza, et al.
Publicado: (2024)
Evaluating Plan Compliance in Autonomous Programming Agents
por: Liu, Shuyang, et al.
Publicado: (2026)
por: Liu, Shuyang, et al.
Publicado: (2026)
VisualCoder: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought Reasoning
por: Le, Cuong Chi, et al.
Publicado: (2024)
por: Le, Cuong Chi, et al.
Publicado: (2024)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
por: He, Minghua, et al.
Publicado: (2025)
por: He, Minghua, et al.
Publicado: (2025)
Large Language Models Versus Static Code Analysis Tools: A Systematic Benchmark for Vulnerability Detection
por: Gnieciak, Damian, et al.
Publicado: (2025)
por: Gnieciak, Damian, et al.
Publicado: (2025)
Automated Code Editing with Search-Generate-Modify
por: Liu, Changshu, et al.
Publicado: (2023)
por: Liu, Changshu, et al.
Publicado: (2023)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
por: Li, Yikun, et al.
Publicado: (2026)
por: Li, Yikun, et al.
Publicado: (2026)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
NExT: Teaching Large Language Models to Reason about Code Execution
por: Ni, Ansong, et al.
Publicado: (2024)
por: Ni, Ansong, et al.
Publicado: (2024)
Can Large Language Models Solve Path Constraints in Symbolic Execution?
por: Wang, Wenhan, et al.
Publicado: (2025)
por: Wang, Wenhan, et al.
Publicado: (2025)
ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
por: Tang, Lingxiao, et al.
Publicado: (2026)
por: Tang, Lingxiao, et al.
Publicado: (2026)
A Study on Thinking Patterns of Large Reasoning Models in Code Generation
por: Halim, Kevin, et al.
Publicado: (2025)
por: Halim, Kevin, et al.
Publicado: (2025)
Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation
por: Abdollahi, Mohammad, et al.
Publicado: (2025)
por: Abdollahi, Mohammad, et al.
Publicado: (2025)
Code Vulnerability Detection: A Comparative Analysis of Emerging Large Language Models
por: Sultana, Shaznin, et al.
Publicado: (2024)
por: Sultana, Shaznin, et al.
Publicado: (2024)
ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
Implementing and Executing Static Analysis Using LLVM and CodeChecker
por: Horvath, Gabor, et al.
Publicado: (2024)
por: Horvath, Gabor, et al.
Publicado: (2024)
Efficient Code Analysis via Graph-Guided Large Language Models
por: Gao, Hang, et al.
Publicado: (2026)
por: Gao, Hang, et al.
Publicado: (2026)
Advancing Code Coverage: Incorporating Program Analysis with Large Language Models
por: Yang, Chen, et al.
Publicado: (2024)
por: Yang, Chen, et al.
Publicado: (2024)
Towards Generating Executable Metamorphic Relations Using Large Language Models
por: Shin, Seung Yeob, et al.
Publicado: (2024)
por: Shin, Seung Yeob, et al.
Publicado: (2024)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Greening Large Language Models of Code
por: Shi, Jieke, et al.
Publicado: (2023)
por: Shi, Jieke, et al.
Publicado: (2023)
Hotfixing Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
Ecosystem of Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
CodeScore: Evaluating Code Generation by Learning Code Execution
por: Dong, Yihong, et al.
Publicado: (2023)
por: Dong, Yihong, et al.
Publicado: (2023)
Ejemplares similares
-
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
por: Liu, Changshu, et al.
Publicado: (2025) -
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024) -
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
por: Liu, Changshu, et al.
Publicado: (2025) -
Narrowing the Complexity Gap in the Evaluation of Large Language Models
por: Chen, Yang, et al.
Publicado: (2026) -
Evaluating LLMs Code Reasoning Under Real-World Context
por: Liu, Changshu
Publicado: (2026)