NesTools: A Dataset for Evaluating Nested Tool Learning Abilities of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Han, Zhu, Tong, Zhang, Xiang, Wu, Mengsong, Xiong, Hao, Chen, Wenliang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Seal-Tools: Self-Instruct Tool Learning Dataset for Agent Tuning and Detailed Benchmark
by: Wu, Mengsong, et al.
Published: (2024)
by: Wu, Mengsong, et al.
Published: (2024)
Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
Controllable and Diverse Data Augmentation with Large Language Model for Low-Resource Open-Domain Dialogue Generation
by: Liu, Zhenhua, et al.
Published: (2024)
by: Liu, Zhenhua, et al.
Published: (2024)
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
by: Hao, Yupu, et al.
Published: (2024)
by: Hao, Yupu, et al.
Published: (2024)
BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
by: Gao, Xin, et al.
Published: (2026)
by: Gao, Xin, et al.
Published: (2026)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
by: Ye, Junjie, et al.
Published: (2025)
by: Ye, Junjie, et al.
Published: (2025)
Learning Evolving Tools for Large Language Models
by: Chen, Guoxin, et al.
Published: (2024)
by: Chen, Guoxin, et al.
Published: (2024)
ICLEval: Evaluating In-Context Learning Ability of Large Language Models
by: Chen, Wentong, et al.
Published: (2024)
by: Chen, Wentong, et al.
Published: (2024)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
by: Guo, Zhicheng, et al.
Published: (2024)
by: Guo, Zhicheng, et al.
Published: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
by: Ye, Junjie, et al.
Published: (2024)
by: Ye, Junjie, et al.
Published: (2024)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
by: Liu, Xukun, et al.
Published: (2024)
by: Liu, Xukun, et al.
Published: (2024)
Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models
by: Lee, Jonggeun, et al.
Published: (2025)
by: Lee, Jonggeun, et al.
Published: (2025)
Alignment for Efficient Tool Calling of Large Language Models
by: Xu, Hongshen, et al.
Published: (2025)
by: Xu, Hongshen, et al.
Published: (2025)
Agentic Tool Use in Large Language Models
by: Hu, Jinchao, et al.
Published: (2026)
by: Hu, Jinchao, et al.
Published: (2026)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
by: Chen, Zehui, et al.
Published: (2023)
by: Chen, Zehui, et al.
Published: (2023)
Evaluating Large Language Models' Ability Using a Psychiatric Screening Tool Based on Metaphor and Sarcasm Scenarios
by: Yakura, Hiromu
Published: (2023)
by: Yakura, Hiromu
Published: (2023)
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
by: He, Zhichao, et al.
Published: (2025)
by: He, Zhichao, et al.
Published: (2025)
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models
by: Ding, Hanxing, et al.
Published: (2025)
by: Ding, Hanxing, et al.
Published: (2025)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
by: Li, Zhuoqun, et al.
Published: (2024)
by: Li, Zhuoqun, et al.
Published: (2024)
MassTool: A Multi-Task Search-Based Tool Retrieval Framework for Large Language Models
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
Tool Learning in the Wild: Empowering Language Models as Automatic Tool Agents
by: Shi, Zhengliang, et al.
Published: (2024)
by: Shi, Zhengliang, et al.
Published: (2024)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
by: Ye, Junjie, et al.
Published: (2024)
by: Ye, Junjie, et al.
Published: (2024)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
by: Liu, Yifei, et al.
Published: (2025)
by: Liu, Yifei, et al.
Published: (2025)
CREATOR: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models
by: Qian, Cheng, et al.
Published: (2023)
by: Qian, Cheng, et al.
Published: (2023)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
by: Ye, Junjie, et al.
Published: (2024)
by: Ye, Junjie, et al.
Published: (2024)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
by: Agarwal, Mayank, et al.
Published: (2025)
by: Agarwal, Mayank, et al.
Published: (2025)
Tool Learning with Large Language Models: A Survey
by: Qu, Changle, et al.
Published: (2024)
by: Qu, Changle, et al.
Published: (2024)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
by: Zhang, Yuxiang, et al.
Published: (2024)
by: Zhang, Yuxiang, et al.
Published: (2024)
UAQFact: Evaluating Factual Knowledge Utilization of LLMs on Unanswerable Questions
by: Tan, Chuanyuan, et al.
Published: (2025)
by: Tan, Chuanyuan, et al.
Published: (2025)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
by: Wang, Yuxia, et al.
Published: (2024)
by: Wang, Yuxia, et al.
Published: (2024)
THaMES: An End-to-End Tool for Hallucination Mitigation and Evaluation in Large Language Models
by: Liang, Mengfei, et al.
Published: (2024)
by: Liang, Mengfei, et al.
Published: (2024)
Tool Calling: Enhancing Medication Consultation via Retrieval-Augmented Large Language Models
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
by: Ma, Zhiyuan, et al.
Published: (2025)
by: Ma, Zhiyuan, et al.
Published: (2025)
Counting Ability of Large Language Models and Impact of Tokenization
by: Zhang, Xiang, et al.
Published: (2024)
by: Zhang, Xiang, et al.
Published: (2024)
TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale
by: Jiang, Pengcheng, et al.
Published: (2024)
by: Jiang, Pengcheng, et al.
Published: (2024)
MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling
by: Zhu, Yakun, et al.
Published: (2024)
by: Zhu, Yakun, et al.
Published: (2024)
Look Before You Leap: Towards Decision-Aware and Generalizable Tool-Usage for Large Language Models
by: Gui, Anchun, et al.
Published: (2024)
by: Gui, Anchun, et al.
Published: (2024)
Large Language Models as Tool Makers
by: Cai, Tianle, et al.
Published: (2023)
by: Cai, Tianle, et al.
Published: (2023)
Similar Items
-
Seal-Tools: Self-Instruct Tool Learning Dataset for Agent Tuning and Detailed Benchmark
by: Wu, Mengsong, et al.
Published: (2024) -
Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models
by: Wu, Mengsong, et al.
Published: (2025) -
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
by: Wu, Mengsong, et al.
Published: (2025) -
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
by: Wu, Mengsong, et al.
Published: (2025) -
Controllable and Diverse Data Augmentation with Large Language Model for Low-Resource Open-Domain Dialogue Generation
by: Liu, Zhenhua, et al.
Published: (2024)