Effective Large Language Model Debugging with Best-first Tree Search
Fuente:
arXiv
Saved in:
| Main Authors: | Song, Jialin, Raiman, Jonathan, Catanzaro, Bryan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ChatDBG: Augmenting Debugging with Large Language Models
by: Levin, Kyla H., et al.
Published: (2024)
by: Levin, Kyla H., et al.
Published: (2024)
Toward Debugging Deep Reinforcement Learning Programs with RLExplorer
by: Bouchoucha, Rached, et al.
Published: (2024)
by: Bouchoucha, Rached, et al.
Published: (2024)
Fully Autonomous Programming using Iterative Multi-Agent Debugging with Large Language Models
by: Grishina, Anastasiia, et al.
Published: (2025)
by: Grishina, Anastasiia, et al.
Published: (2025)
Debugging and Runtime Analysis of Neural Networks with VLMs (A Case Study)
by: Hu, Boyue Caroline, et al.
Published: (2025)
by: Hu, Boyue Caroline, et al.
Published: (2025)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
by: Liu, Jingjing, et al.
Published: (2025)
by: Liu, Jingjing, et al.
Published: (2025)
Learning to Generate Unit Tests for Automated Debugging
by: Prasad, Archiki, et al.
Published: (2025)
by: Prasad, Archiki, et al.
Published: (2025)
Automatic Programming: Large Language Models and Beyond
by: Lyu, Michael R., et al.
Published: (2024)
by: Lyu, Michael R., et al.
Published: (2024)
Generating Streamlining Constraints with Large Language Models
by: Voboril, Florentina, et al.
Published: (2024)
by: Voboril, Florentina, et al.
Published: (2024)
Are Large Language Models Memorizing Bug Benchmarks?
by: Ramos, Daniel, et al.
Published: (2024)
by: Ramos, Daniel, et al.
Published: (2024)
DebugBench: Evaluating Debugging Capability of Large Language Models
by: Tian, Runchu, et al.
Published: (2024)
by: Tian, Runchu, et al.
Published: (2024)
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
by: Sorokin, Lev, et al.
Published: (2024)
by: Sorokin, Lev, et al.
Published: (2024)
Large Language Model Guided Self-Debugging Code Generation
by: Adnan, Muntasir, et al.
Published: (2025)
by: Adnan, Muntasir, et al.
Published: (2025)
Benchmarking Large Language Models with Integer Sequence Generation Tasks
by: O'Malley, Daniel, et al.
Published: (2024)
by: O'Malley, Daniel, et al.
Published: (2024)
Toward Explaining Large Language Models in Software Engineering Tasks
by: Vitale, Antonio, et al.
Published: (2025)
by: Vitale, Antonio, et al.
Published: (2025)
Exploring the Integration of Large Language Models in Industrial Test Maintenance Processes
by: Liu, Jingxiong, et al.
Published: (2024)
by: Liu, Jingxiong, et al.
Published: (2024)
Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models
by: Haroon, Sabaat, et al.
Published: (2025)
by: Haroon, Sabaat, et al.
Published: (2025)
ProToken: Token-Level Attribution for Federated Large Language Models
by: Gill, Waris, et al.
Published: (2026)
by: Gill, Waris, et al.
Published: (2026)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
by: Sharma, Aman, et al.
Published: (2026)
by: Sharma, Aman, et al.
Published: (2026)
Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages
by: Bogavelli, Tara, et al.
Published: (2026)
by: Bogavelli, Tara, et al.
Published: (2026)
Consolidating TinyML Lifecycle with Large Language Models: Reality, Illusion, or Opportunity?
by: Wu, Guanghan, et al.
Published: (2025)
by: Wu, Guanghan, et al.
Published: (2025)
Zero-Shot Attribution for Large Language Models: A Distribution Testing Approach
by: Canonne, Clément L., et al.
Published: (2025)
by: Canonne, Clément L., et al.
Published: (2025)
AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks
by: Oulkadda, Ilyas, et al.
Published: (2025)
by: Oulkadda, Ilyas, et al.
Published: (2025)
CONSTRUCTA: Automating Commercial Construction Schedules in Fabrication Facilities with Large Language Models
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
Regression Language Models for Code
by: Akhauri, Yash, et al.
Published: (2025)
by: Akhauri, Yash, et al.
Published: (2025)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
by: Wu, Yixi, et al.
Published: (2024)
by: Wu, Yixi, et al.
Published: (2024)
Large Language Models Should Ask Clarifying Questions to Increase Confidence in Generated Code
by: Wu, Jie JW
Published: (2023)
by: Wu, Jie JW
Published: (2023)
Assessing Large Language Models for Automated Feedback Generation in Learning Programming Problem Solving
by: Silva, Priscylla, et al.
Published: (2025)
by: Silva, Priscylla, et al.
Published: (2025)
Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
by: Zhou, Yongxi, et al.
Published: (2026)
by: Zhou, Yongxi, et al.
Published: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026)
by: Li, Yuangang, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning of Large Language Models for Unit Test Generation: An Empirical Study
by: Storhaug, André, et al.
Published: (2024)
by: Storhaug, André, et al.
Published: (2024)
CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model
by: Di, Peng, et al.
Published: (2023)
by: Di, Peng, et al.
Published: (2023)
Debugging code world models
by: Rahmani, Babak
Published: (2026)
by: Rahmani, Babak
Published: (2026)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
by: Chen, Jie, et al.
Published: (2024)
by: Chen, Jie, et al.
Published: (2024)
Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization
by: Rafi, Md Nakhla, et al.
Published: (2024)
by: Rafi, Md Nakhla, et al.
Published: (2024)
StackSight: Unveiling WebAssembly through Large Language Models and Neurosymbolic Chain-of-Thought Decompilation
by: Fang, Weike, et al.
Published: (2024)
by: Fang, Weike, et al.
Published: (2024)
Prism: Dynamic and Flexible Benchmarking of LLMs Code Generation with Monte Carlo Tree Search
by: Majdinasab, Vahid, et al.
Published: (2025)
by: Majdinasab, Vahid, et al.
Published: (2025)
Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization
by: Chen, Zhi, et al.
Published: (2024)
by: Chen, Zhi, et al.
Published: (2024)
FlakyFix: Using Large Language Models for Predicting Flaky Test Fix Categories and Test Code Repair
by: Fatima, Sakina, et al.
Published: (2023)
by: Fatima, Sakina, et al.
Published: (2023)
A Cartography of Open Collaboration in Open Source AI: Mapping Practices, Motivations, and Governance in 14 Open Large Language Model Projects
by: Linåker, Johan, et al.
Published: (2025)
by: Linåker, Johan, et al.
Published: (2025)
DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery
by: Liu, Tianyu, et al.
Published: (2026)
by: Liu, Tianyu, et al.
Published: (2026)
Similar Items
-
ChatDBG: Augmenting Debugging with Large Language Models
by: Levin, Kyla H., et al.
Published: (2024) -
Toward Debugging Deep Reinforcement Learning Programs with RLExplorer
by: Bouchoucha, Rached, et al.
Published: (2024) -
Fully Autonomous Programming using Iterative Multi-Agent Debugging with Large Language Models
by: Grishina, Anastasiia, et al.
Published: (2025) -
Debugging and Runtime Analysis of Neural Networks with VLMs (A Case Study)
by: Hu, Boyue Caroline, et al.
Published: (2025) -
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
by: Liu, Jingjing, et al.
Published: (2025)