StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Zhicheng, Cheng, Sijie, Wang, Hao, Liang, Shihao, Qin, Yujia, Li, Peng, Liu, Zhiyuan, Sun, Maosong, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIs
par: Guo, Zhicheng, et autres
Publié: (2025)
par: Guo, Zhicheng, et autres
Publié: (2025)
CREATOR: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models
par: Qian, Cheng, et autres
Publié: (2023)
par: Qian, Cheng, et autres
Publié: (2023)
DebugBench: Evaluating Debugging Capability of Large Language Models
par: Tian, Runchu, et autres
Publié: (2024)
par: Tian, Runchu, et autres
Publié: (2024)
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
par: Cheng, Zihao, et autres
Publié: (2025)
par: Cheng, Zihao, et autres
Publié: (2025)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
par: Liu, Xukun, et autres
Publié: (2024)
par: Liu, Xukun, et autres
Publié: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
par: Li, Jianling, et autres
Publié: (2025)
par: Li, Jianling, et autres
Publié: (2025)
MatTools: Benchmarking Large Language Models for Materials Science Tools
par: Liu, Siyu, et autres
Publié: (2025)
par: Liu, Siyu, et autres
Publié: (2025)
Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Exploring Format Consistency for Instruction Tuning
par: Liang, Shihao, et autres
Publié: (2023)
par: Liang, Shihao, et autres
Publié: (2023)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
par: Huang, Yue, et autres
Publié: (2023)
par: Huang, Yue, et autres
Publié: (2023)
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models
par: Ding, Hanxing, et autres
Publié: (2025)
par: Ding, Hanxing, et autres
Publié: (2025)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2025)
par: Xu, Qiancheng, et autres
Publié: (2025)
AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant
par: Zhou, Yujia, et autres
Publié: (2024)
par: Zhou, Yujia, et autres
Publié: (2024)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
UniMem: Towards a Unified View of Long-Context Large Language Models
par: Fang, Junjie, et autres
Publié: (2024)
par: Fang, Junjie, et autres
Publié: (2024)
LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
par: Gao, Jian, et autres
Publié: (2025)
par: Gao, Jian, et autres
Publié: (2025)
Learning Evolving Tools for Large Language Models
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models
par: Shen, Zhanyu, et autres
Publié: (2026)
par: Shen, Zhanyu, et autres
Publié: (2026)
NesTools: A Dataset for Evaluating Nested Tool Learning Abilities of Large Language Models
par: Han, Han, et autres
Publié: (2024)
par: Han, Han, et autres
Publié: (2024)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
par: Wang, Zhenting, et autres
Publié: (2025)
par: Wang, Zhenting, et autres
Publié: (2025)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
par: Liu, Yifei, et autres
Publié: (2025)
par: Liu, Yifei, et autres
Publié: (2025)
Stable Knowledge Editing in Large Language Models
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
par: Nie, Ying, et autres
Publié: (2024)
par: Nie, Ying, et autres
Publié: (2024)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
par: Ning, Kangyun, et autres
Publié: (2024)
par: Ning, Kangyun, et autres
Publié: (2024)
Tool Learning with Foundation Models
par: Qin, Yujia, et autres
Publié: (2023)
par: Qin, Yujia, et autres
Publié: (2023)
A Top-down Graph-based Tool for Modeling Classical Semantic Maps: A Crosslinguistic Case Study of Supplementary Adverbs
par: Liu, Zhu, et autres
Publié: (2024)
par: Liu, Zhu, et autres
Publié: (2024)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
AppSelectBench: Application-Level Tool Selection Benchmark
par: Chen, Tianyi, et autres
Publié: (2025)
par: Chen, Tianyi, et autres
Publié: (2025)
Metacognitive Retrieval-Augmented Large Language Models
par: Zhou, Yujia, et autres
Publié: (2024)
par: Zhou, Yujia, et autres
Publié: (2024)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
par: Shi, Zhengliang, et autres
Publié: (2025)
par: Shi, Zhengliang, et autres
Publié: (2025)
Empowering Private Tutoring by Chaining Large Language Models
par: Chen, Yulin, et autres
Publié: (2023)
par: Chen, Yulin, et autres
Publié: (2023)
Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks
par: Vishwanath, Krithik, et autres
Publié: (2025)
par: Vishwanath, Krithik, et autres
Publié: (2025)
BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative Tasks
par: Wang, Hanqing, et autres
Publié: (2024)
par: Wang, Hanqing, et autres
Publié: (2024)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
Documents similaires
-
StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIs
par: Guo, Zhicheng, et autres
Publié: (2025) -
CREATOR: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models
par: Qian, Cheng, et autres
Publié: (2023) -
DebugBench: Evaluating Debugging Capability of Large Language Models
par: Tian, Runchu, et autres
Publié: (2024) -
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
par: Cheng, Zihao, et autres
Publié: (2025) -
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
par: Wang, Pei, et autres
Publié: (2024)