ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Junjie, Du, Zhengyin, Yao, Xuesong, Lin, Weijian, Xu, Yufei, Chen, Zehui, Wang, Zaiyuan, Zhu, Sining, Xi, Zhiheng, Yuan, Siyu, Gui, Tao, Zhang, Qi, Huang, Xuanjing, Chen, Jiecao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training
par: Yuan, Siyu, et autres
Publié: (2025)
par: Yuan, Siyu, et autres
Publié: (2025)
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
CCTU: A Benchmark for Tool Use under Complex Constraints
par: Ye, Junjie, et autres
Publié: (2026)
par: Ye, Junjie, et autres
Publié: (2026)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Recitation over Reasoning: How Cutting-Edge Language Models Can Fail on Elementary School-Level Reasoning Problems?
par: Yan, Kai, et autres
Publié: (2025)
par: Yan, Kai, et autres
Publié: (2025)
Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
par: Du, Weihua, et autres
Publié: (2025)
par: Du, Weihua, et autres
Publié: (2025)
FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
par: Huang, Caishuang, et autres
Publié: (2026)
par: Huang, Caishuang, et autres
Publié: (2026)
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
par: Tang, Yixuan, et autres
Publié: (2024)
par: Tang, Yixuan, et autres
Publié: (2024)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
par: Ling, Zhan, et autres
Publié: (2025)
par: Ling, Zhan, et autres
Publié: (2025)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
par: Biran, Eden, et autres
Publié: (2024)
par: Biran, Eden, et autres
Publié: (2024)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMs
par: Bian, Haonan, et autres
Publié: (2025)
par: Bian, Haonan, et autres
Publié: (2025)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
par: Hu, Xuhao, et autres
Publié: (2026)
par: Hu, Xuhao, et autres
Publié: (2026)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
HopGNN: Boosting Distributed GNN Training Efficiency via Feature-Centric Model Migration
par: Chen, Weijian, et autres
Publié: (2024)
par: Chen, Weijian, et autres
Publié: (2024)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
par: Huang, Shiting, et autres
Publié: (2025)
par: Huang, Shiting, et autres
Publié: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
par: Jiang, Dongfu, et autres
Publié: (2025)
par: Jiang, Dongfu, et autres
Publié: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
All-Hops Shortest Paths
par: Williams, Virginia Vassilevska, et autres
Publié: (2024)
par: Williams, Virginia Vassilevska, et autres
Publié: (2024)
ConRAG: Consensus-Driven Multi-View Retrieval for Multi-Hop Question Answering
par: Zhu, Yikai, et autres
Publié: (2026)
par: Zhu, Yikai, et autres
Publié: (2026)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
STanHop: Sparse Tandem Hopfield Model for Memory-Enhanced Time Series Prediction
par: Wu, Dennis, et autres
Publié: (2023)
par: Wu, Dennis, et autres
Publié: (2023)
MatTools: Benchmarking Large Language Models for Materials Science Tools
par: Liu, Siyu, et autres
Publié: (2025)
par: Liu, Siyu, et autres
Publié: (2025)
Query, Decompose, Compress: Structured Query Expansion for Efficient Multi-Hop Retrieval
par: Yun, JungMin, et autres
Publié: (2026)
par: Yun, JungMin, et autres
Publié: (2026)
Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challenges
par: Wang, Hongru, et autres
Publié: (2025)
par: Wang, Hongru, et autres
Publié: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
par: Wang, Shenzhi, et autres
Publié: (2026)
par: Wang, Shenzhi, et autres
Publié: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
Multipath Routing for Multi-Hop UAV Networks
par: Zhao, Zhenyu, et autres
Publié: (2026)
par: Zhao, Zhenyu, et autres
Publié: (2026)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
par: Shen, Yujiong, et autres
Publié: (2026)
par: Shen, Yujiong, et autres
Publié: (2026)
HipHop
Publié: (2020)
Publié: (2020)
Batch Hop-Constrained s-t Simple Path Query Processing in Large Graphs
par: Yuan, Long, et autres
Publié: (2023)
par: Yuan, Long, et autres
Publié: (2023)
One-Hop Sub-Query Result Caches for Graph Database Systems
par: Nguyen, Hieu, et autres
Publié: (2024)
par: Nguyen, Hieu, et autres
Publié: (2024)
Data-Efficient Massive Tool Retrieval: A Reinforcement Learning Approach for Query-Tool Alignment with Language Models
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents
par: Saberi, Mehrdad, et autres
Publié: (2026)
par: Saberi, Mehrdad, et autres
Publié: (2026)
Documents similaires
-
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025) -
Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training
par: Yuan, Siyu, et autres
Publié: (2025) -
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
par: Ye, Junjie, et autres
Publié: (2024) -
CCTU: A Benchmark for Tool Use under Complex Constraints
par: Ye, Junjie, et autres
Publié: (2026) -
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)