NExT: Teaching Large Language Models to Reason about Code Execution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ni, Ansong, Allamanis, Miltiadis, Cohan, Arman, Deng, Yinlin, Shi, Kensen, Sutton, Charles, Yin, Pengcheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
par: Riddell, Martin, et autres
Publié: (2024)
par: Riddell, Martin, et autres
Publié: (2024)
Disproving Program Equivalence with LLMs
par: Allamanis, Miltiadis, et autres
Publié: (2025)
par: Allamanis, Miltiadis, et autres
Publié: (2025)
Unsupervised Evaluation of Code LLMs with Round-Trip Correctness
par: Allamanis, Miltiadis, et autres
Publié: (2024)
par: Allamanis, Miltiadis, et autres
Publié: (2024)
Grounding Data Science Code Generation with Input-Output Specifications
par: Wen, Yeming, et autres
Publié: (2024)
par: Wen, Yeming, et autres
Publié: (2024)
Do Large Code Models Understand Programming Concepts? Counterfactual Analysis for Code Predicates
par: Hooda, Ashish, et autres
Publié: (2024)
par: Hooda, Ashish, et autres
Publié: (2024)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
par: Yu, Zhaojian, et autres
Publié: (2024)
par: Yu, Zhaojian, et autres
Publié: (2024)
ExeDec: Execution Decomposition for Compositional Generalization in Neural Program Synthesis
par: Shi, Kensen, et autres
Publié: (2023)
par: Shi, Kensen, et autres
Publié: (2023)
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
LocAgent: Graph-Guided LLM Agents for Code Localization
par: Chen, Zhaoling, et autres
Publié: (2025)
par: Chen, Zhaoling, et autres
Publié: (2025)
CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification
par: Tian, Yuchen, et autres
Publié: (2024)
par: Tian, Yuchen, et autres
Publié: (2024)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
par: Xie, Yiqing, et autres
Publié: (2024)
par: Xie, Yiqing, et autres
Publié: (2024)
Python Symbolic Execution with LLM-powered Code Generation
par: Wang, Wenhan, et autres
Publié: (2024)
par: Wang, Wenhan, et autres
Publié: (2024)
GenX: Mastering Code and Test Generation with Execution Feedback
par: Wang, Nan, et autres
Publié: (2024)
par: Wang, Nan, et autres
Publié: (2024)
Creating a Trajectory for Code Writing: Algorithmic Reasoning Tasks
par: Ravikumar, Shruthi, et autres
Publié: (2024)
par: Ravikumar, Shruthi, et autres
Publié: (2024)
PurpCode: Reasoning for Safer Code Generation
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation
par: Ni, Yuansheng, et autres
Publié: (2025)
par: Ni, Yuansheng, et autres
Publié: (2025)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
par: Chen, Zaoyu, et autres
Publié: (2026)
par: Chen, Zaoyu, et autres
Publié: (2026)
Defusing Logic Bombs in Symbolic Execution with LLM-Generated Ghost Code
par: Bouras, Dimitrios Stamatios, et autres
Publié: (2026)
par: Bouras, Dimitrios Stamatios, et autres
Publié: (2026)
Enhancing Project-Specific Code Completion by Inferring Internal API Information
par: Deng, Le, et autres
Publié: (2025)
par: Deng, Le, et autres
Publié: (2025)
Bridging Code Graphs and Large Language Models for Better Code Understanding
par: Chen, Zeqi, et autres
Publié: (2025)
par: Chen, Zeqi, et autres
Publié: (2025)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
par: Yang, Chenyuan, et autres
Publié: (2023)
par: Yang, Chenyuan, et autres
Publié: (2023)
DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode
par: Han, Hojae, et autres
Publié: (2026)
par: Han, Hojae, et autres
Publié: (2026)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)
par: Yadavally, Aashish, et autres
Publié: (2025)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
par: Chou, Jason, et autres
Publié: (2025)
par: Chou, Jason, et autres
Publié: (2025)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
par: Deng, Ken, et autres
Publié: (2024)
par: Deng, Ken, et autres
Publié: (2024)
Executing as You Generate: Hiding Execution Latency in LLM Code Generation
par: Sun, Zhensu, et autres
Publié: (2026)
par: Sun, Zhensu, et autres
Publié: (2026)
CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation
par: Yan, Weixiang, et autres
Publié: (2023)
par: Yan, Weixiang, et autres
Publié: (2023)
OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement
par: Zheng, Tianyu, et autres
Publié: (2024)
par: Zheng, Tianyu, et autres
Publié: (2024)
Can Large Language Models Simulate Symbolic Execution Output Like KLEE?
par: Feng, Rong, et autres
Publié: (2025)
par: Feng, Rong, et autres
Publié: (2025)
KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents
par: Guerin, Cormac, et autres
Publié: (2026)
par: Guerin, Cormac, et autres
Publié: (2026)
SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis
par: Li, Yansong, et autres
Publié: (2025)
par: Li, Yansong, et autres
Publié: (2025)
Teaching LLMs Program Semantics via Symbolic Execution Traces
par: Bayer, Jonas, et autres
Publié: (2026)
par: Bayer, Jonas, et autres
Publié: (2026)
Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation
par: Pysklo, Hubert M., et autres
Publié: (2026)
par: Pysklo, Hubert M., et autres
Publié: (2026)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
par: Du, Mingzhe, et autres
Publié: (2024)
par: Du, Mingzhe, et autres
Publié: (2024)
Natural Language Outlines for Code: Literate Programming in the LLM Era
par: Shi, Kensen, et autres
Publié: (2024)
par: Shi, Kensen, et autres
Publié: (2024)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
par: Lin, Hong Yi, et autres
Publié: (2025)
par: Lin, Hong Yi, et autres
Publié: (2025)
Documents similaires
-
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
par: Riddell, Martin, et autres
Publié: (2024) -
Disproving Program Equivalence with LLMs
par: Allamanis, Miltiadis, et autres
Publié: (2025) -
Unsupervised Evaluation of Code LLMs with Round-Trip Correctness
par: Allamanis, Miltiadis, et autres
Publié: (2024) -
Grounding Data Science Code Generation with Input-Output Specifications
par: Wen, Yeming, et autres
Publié: (2024) -
Do Large Code Models Understand Programming Concepts? Counterfactual Analysis for Code Predicates
par: Hooda, Ashish, et autres
Publié: (2024)