Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-step
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Li, Wang, Zilong, Shang, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can ChatGPT replace StackOverflow? A Study on Robustness and Reliability of Large Language Model Code Generation
par: Zhong, Li, et autres
Publié: (2023)
par: Zhong, Li, et autres
Publié: (2023)
DebugBench: Evaluating Debugging Capability of Large Language Models
par: Tian, Runchu, et autres
Publié: (2024)
par: Tian, Runchu, et autres
Publié: (2024)
RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance
par: Jin, Haolin, et autres
Publié: (2024)
par: Jin, Haolin, et autres
Publié: (2024)
Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents
par: Zhao, Chenyu, et autres
Publié: (2026)
par: Zhao, Chenyu, et autres
Publié: (2026)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)
par: Yadavally, Aashish, et autres
Publié: (2025)
LeDex: Training LLMs to Better Self-Debug and Explain Code
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Type-Aware Retrieval-Augmented Generation with Dependency Closure for Solver-Executable Industrial Optimization Modeling
par: Zhong, Y., et autres
Publié: (2026)
par: Zhong, Y., et autres
Publié: (2026)
BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
par: Zhuo, Terry Yue, et autres
Publié: (2025)
par: Zhuo, Terry Yue, et autres
Publié: (2025)
Mitigating Gender Bias in Code Large Language Models via Model Editing
par: Qin, Zhanyue, et autres
Publié: (2024)
par: Qin, Zhanyue, et autres
Publié: (2024)
ChatDBG: Augmenting Debugging with Large Language Models
par: Levin, Kyla H., et autres
Publié: (2024)
par: Levin, Kyla H., et autres
Publié: (2024)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
par: Shi, Yuling, et autres
Publié: (2024)
par: Shi, Yuling, et autres
Publié: (2024)
Investigating Execution-Aware Language Models for Code Optimization
par: Di Menna, Federico, et autres
Publié: (2025)
par: Di Menna, Federico, et autres
Publié: (2025)
WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning
par: Yu, Zhaojian, et autres
Publié: (2023)
par: Yu, Zhaojian, et autres
Publié: (2023)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
par: Liu, Jingjing, et autres
Publié: (2025)
par: Liu, Jingjing, et autres
Publié: (2025)
debug-gym: A Text-Based Environment for Interactive Debugging
par: Yuan, Xingdi, et autres
Publié: (2025)
par: Yuan, Xingdi, et autres
Publié: (2025)
CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging
par: Islam, Md. Ashraful, et autres
Publié: (2025)
par: Islam, Md. Ashraful, et autres
Publié: (2025)
WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language Models
par: Fan, Shengda, et autres
Publié: (2024)
par: Fan, Shengda, et autres
Publié: (2024)
Shepherd: A Runtime Substrate Empowering Meta-Agents with a Formalized Execution Trace
par: Yu, Simon, et autres
Publié: (2026)
par: Yu, Simon, et autres
Publié: (2026)
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases
par: Liu, Xiangyan, et autres
Publié: (2024)
par: Liu, Xiangyan, et autres
Publié: (2024)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
par: Wang, Wenxuan
Publié: (2024)
par: Wang, Wenxuan
Publié: (2024)
A Survey on Large Language Models for Code Generation
par: Jiang, Juyong, et autres
Publié: (2024)
par: Jiang, Juyong, et autres
Publié: (2024)
Exploring Large Language Models in Resolving Environment-Related Crash Bugs: Localizing and Repairing
par: Du, Xueying, et autres
Publié: (2023)
par: Du, Xueying, et autres
Publié: (2023)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
par: Kim, Hyunjun, et autres
Publié: (2025)
par: Kim, Hyunjun, et autres
Publié: (2025)
Learning to Generate Unit Tests for Automated Debugging
par: Prasad, Archiki, et autres
Publié: (2025)
par: Prasad, Archiki, et autres
Publié: (2025)
aiXcoder-7B: A Lightweight and Effective Large Language Model for Code Processing
par: Jiang, Siyuan, et autres
Publié: (2024)
par: Jiang, Siyuan, et autres
Publié: (2024)
AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms
par: Zhao, Haoyu, et autres
Publié: (2026)
par: Zhao, Haoyu, et autres
Publié: (2026)
Exploring Data-Efficient Adaptation of Large Language Models for Code Generation
par: Jiang, Xue, et autres
Publié: (2024)
par: Jiang, Xue, et autres
Publié: (2024)
Evaluating the Ability of Large Language Models to Generate Verifiable Specifications in VeriFast
par: Fan, Wen, et autres
Publié: (2024)
par: Fan, Wen, et autres
Publié: (2024)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
par: Li, Yikun, et autres
Publié: (2026)
par: Li, Yikun, et autres
Publié: (2026)
CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at Scale
par: Wang, Chenlong, et autres
Publié: (2025)
par: Wang, Chenlong, et autres
Publié: (2025)
CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation
par: Yan, Weixiang, et autres
Publié: (2023)
par: Yan, Weixiang, et autres
Publié: (2023)
AdaptiveLog: An Adaptive Log Analysis Framework with the Collaboration of Large and Small Language Model
par: Ma, Lipeng, et autres
Publié: (2025)
par: Ma, Lipeng, et autres
Publié: (2025)
Analyzing the Performance of Large Language Models on Code Summarization
par: Haldar, Rajarshi, et autres
Publié: (2024)
par: Haldar, Rajarshi, et autres
Publié: (2024)
ContraFix: Agentic Vulnerability Repair via Differential Runtime Evidence and Skill Reuse
par: Liu, Simiao, et autres
Publié: (2026)
par: Liu, Simiao, et autres
Publié: (2026)
VerMCTS: Synthesizing Multi-Step Programs using a Verifier, a Large Language Model, and Tree Search
par: Brandfonbrener, David, et autres
Publié: (2024)
par: Brandfonbrener, David, et autres
Publié: (2024)
From Critique to Clarity: A Pathway to Faithful and Personalized Code Explanations with Large Language Models
par: Xu, Zexing, et autres
Publié: (2024)
par: Xu, Zexing, et autres
Publié: (2024)
Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
par: Huang, Yuheng, et autres
Publié: (2023)
par: Huang, Yuheng, et autres
Publié: (2023)
Revisiting the Reliability of Language Models in Instruction-Following
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
Chain-of-Programming (CoP) : Empowering Large Language Models for Geospatial Code Generation
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
Documents similaires
-
Can ChatGPT replace StackOverflow? A Study on Robustness and Reliability of Large Language Model Code Generation
par: Zhong, Li, et autres
Publié: (2023) -
DebugBench: Evaluating Debugging Capability of Large Language Models
par: Tian, Runchu, et autres
Publié: (2024) -
RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance
par: Jin, Haolin, et autres
Publié: (2024) -
Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents
par: Zhao, Chenyu, et autres
Publié: (2026) -
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)