Why Stop at One Error? Benchmarking LLMs as Data Science Code Debuggers for Multi-Hop and Multi-Bug Errors
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Zhiyu, Wang, Shuo, Yan, Yukun, Deng, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
por: Tang, Yixuan, et al.
Publicado: (2024)
por: Tang, Yixuan, et al.
Publicado: (2024)
An Interactive Debugger for Rust Trait Errors
por: Gray, Gavin, et al.
Publicado: (2025)
por: Gray, Gavin, et al.
Publicado: (2025)
Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG
por: Bang, Jihwan, et al.
Publicado: (2025)
por: Bang, Jihwan, et al.
Publicado: (2025)
Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction
por: Labib, Adnan, et al.
Publicado: (2026)
por: Labib, Adnan, et al.
Publicado: (2026)
HopWeaver: Cross-Document Synthesis of High-Quality and Authentic Multi-Hop Questions
por: Shen, Zhiyu, et al.
Publicado: (2025)
por: Shen, Zhiyu, et al.
Publicado: (2025)
CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
por: Liu, Hao, et al.
Publicado: (2025)
por: Liu, Hao, et al.
Publicado: (2025)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
por: Kim, Yunsoo, et al.
Publicado: (2025)
por: Kim, Yunsoo, et al.
Publicado: (2025)
Multi-head Sequence Tagging Model for Grammatical Error Correction
por: Al-Sabahi, Kamal, et al.
Publicado: (2024)
por: Al-Sabahi, Kamal, et al.
Publicado: (2024)
From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMs
por: Bian, Haonan, et al.
Publicado: (2025)
por: Bian, Haonan, et al.
Publicado: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
por: Wang, Shenzhi, et al.
Publicado: (2026)
por: Wang, Shenzhi, et al.
Publicado: (2026)
MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Tail Knowledge
por: He, Jie, et al.
Publicado: (2024)
por: He, Jie, et al.
Publicado: (2024)
Making Long-Context Language Models Better Multi-Hop Reasoners
por: Li, Yanyang, et al.
Publicado: (2024)
por: Li, Yanyang, et al.
Publicado: (2024)
MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms
por: Wang, Yibo, et al.
Publicado: (2025)
por: Wang, Yibo, et al.
Publicado: (2025)
Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
por: Yadav, Anushka, et al.
Publicado: (2025)
por: Yadav, Anushka, et al.
Publicado: (2025)
Credible Plan-Driven RAG Method for Multi-Hop Question Answering
por: Zhang, Ningning, et al.
Publicado: (2025)
por: Zhang, Ningning, et al.
Publicado: (2025)
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
por: Biran, Eden, et al.
Publicado: (2024)
por: Biran, Eden, et al.
Publicado: (2024)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
por: Wang, Sizhe, et al.
Publicado: (2025)
por: Wang, Sizhe, et al.
Publicado: (2025)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
por: Ye, Junjie, et al.
Publicado: (2025)
por: Ye, Junjie, et al.
Publicado: (2025)
ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection
por: Yan, Yibo, et al.
Publicado: (2024)
por: Yan, Yibo, et al.
Publicado: (2024)
RGD: Multi-LLM Based Agent Debugger via Refinement and Generation Guidance
por: Jin, Haolin, et al.
Publicado: (2024)
por: Jin, Haolin, et al.
Publicado: (2024)
Leveraging LLMs for Bangla Grammar Error Correction:Error Categorization, Synthetic Data, and Model Evaluation
por: Bhattacharyya, Pramit, et al.
Publicado: (2024)
por: Bhattacharyya, Pramit, et al.
Publicado: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
por: Ko, Yuka, et al.
Publicado: (2024)
por: Ko, Yuka, et al.
Publicado: (2024)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
por: Wu, Zhuoyang, et al.
Publicado: (2025)
por: Wu, Zhuoyang, et al.
Publicado: (2025)
OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning
por: Kim, Seunghee, et al.
Publicado: (2025)
por: Kim, Seunghee, et al.
Publicado: (2025)
FactCG: Enhancing Fact Checkers with Graph-Based Multi-Hop Data
por: Lei, Deren, et al.
Publicado: (2025)
por: Lei, Deren, et al.
Publicado: (2025)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
por: Xiong, Boya, et al.
Publicado: (2025)
por: Xiong, Boya, et al.
Publicado: (2025)
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
por: Ying, Jiahao, et al.
Publicado: (2024)
por: Ying, Jiahao, et al.
Publicado: (2024)
What External Knowledge is Preferred by LLMs? Characterizing and Exploring Chain of Evidence in Imperfect Context for Multi-Hop QA
por: Chang, Zhiyuan, et al.
Publicado: (2024)
por: Chang, Zhiyuan, et al.
Publicado: (2024)
Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs
por: Yang, Jaewoo, et al.
Publicado: (2024)
por: Yang, Jaewoo, et al.
Publicado: (2024)
Watermarking Language Models with Error Correcting Codes
por: Chao, Patrick, et al.
Publicado: (2024)
por: Chao, Patrick, et al.
Publicado: (2024)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
por: Yu, Erxin, et al.
Publicado: (2025)
por: Yu, Erxin, et al.
Publicado: (2025)
Evaluating LLMs at Detecting Errors in LLM Responses
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
por: Yang, Sohee, et al.
Publicado: (2024)
por: Yang, Sohee, et al.
Publicado: (2024)
SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents
por: Saberi, Mehrdad, et al.
Publicado: (2026)
por: Saberi, Mehrdad, et al.
Publicado: (2026)
A Formal Framework for Fluency-based Multi-Reference Evaluation in Grammatical Error Correction
por: Klinger, Eitan, et al.
Publicado: (2025)
por: Klinger, Eitan, et al.
Publicado: (2025)
Coffee: Boost Your Code LLMs by Fixing Bugs with Feedback
por: Moon, Seungjun, et al.
Publicado: (2023)
por: Moon, Seungjun, et al.
Publicado: (2023)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
por: He, Yun, et al.
Publicado: (2024)
por: He, Yun, et al.
Publicado: (2024)
Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
por: Tong, Yongqi, et al.
Publicado: (2024)
por: Tong, Yongqi, et al.
Publicado: (2024)
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
por: Wang, Haoran, et al.
Publicado: (2024)
por: Wang, Haoran, et al.
Publicado: (2024)
Ejemplares similares
-
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
por: Tang, Yixuan, et al.
Publicado: (2024) -
An Interactive Debugger for Rust Trait Errors
por: Gray, Gavin, et al.
Publicado: (2025) -
Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG
por: Bang, Jihwan, et al.
Publicado: (2025) -
Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction
por: Labib, Adnan, et al.
Publicado: (2026) -
HopWeaver: Cross-Document Synthesis of High-Quality and Authentic Multi-Hop Questions
por: Shen, Zhiyu, et al.
Publicado: (2025)