ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Agarwal, Mayank, Abdelaziz, Ibrahim, Basu, Kinjal, Unuvar, Merve, Lastras, Luis A., Rizk, Yara, Kapanipathi, Pavan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NESTFUL: A Benchmark for Evaluating LLMs on Nested Sequences of API Calls
by: Basu, Kinjal, et al.
Published: (2024)
by: Basu, Kinjal, et al.
Published: (2024)
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025)
by: Li, Renhao, et al.
Published: (2025)
Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments
by: Crouse, Maxwell, et al.
Published: (2026)
by: Crouse, Maxwell, et al.
Published: (2026)
Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular Tasks
by: Abdelaziz, Ibrahim, et al.
Published: (2024)
by: Abdelaziz, Ibrahim, et al.
Published: (2024)
Formally Specifying the High-Level Behavior of LLM-Based Agents
by: Crouse, Maxwell, et al.
Published: (2023)
by: Crouse, Maxwell, et al.
Published: (2023)
API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMs
by: Basu, Kinjal, et al.
Published: (2024)
by: Basu, Kinjal, et al.
Published: (2024)
R2D2: Remembering, Replaying and Dynamic Decision Making with a Reflective Agentic Memory
by: Huang, Tenghao, et al.
Published: (2025)
by: Huang, Tenghao, et al.
Published: (2025)
LongFuncEval: Measuring the effectiveness of long context models for function calling
by: Kate, Kiran, et al.
Published: (2025)
by: Kate, Kiran, et al.
Published: (2025)
Putting It All into Context: Simplifying Agents with LCLMs
by: Jiang, Mingjian, et al.
Published: (2025)
by: Jiang, Mingjian, et al.
Published: (2025)
Alignment for Efficient Tool Calling of Large Language Models
by: Xu, Hongshen, et al.
Published: (2025)
by: Xu, Hongshen, et al.
Published: (2025)
BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
by: Gao, Xin, et al.
Published: (2026)
by: Gao, Xin, et al.
Published: (2026)
Natural Language Tools: A Natural Language Approach to Tool Calling In Large Language Agents
by: Johnson, Reid T., et al.
Published: (2025)
by: Johnson, Reid T., et al.
Published: (2025)
Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
by: Luo, Zheng, et al.
Published: (2026)
by: Luo, Zheng, et al.
Published: (2026)
Tool-Augmented Reward Modeling
by: Li, Lei, et al.
Published: (2023)
by: Li, Lei, et al.
Published: (2023)
How Good Are LLMs at Processing Tool Outputs?
by: Kate, Kiran, et al.
Published: (2025)
by: Kate, Kiran, et al.
Published: (2025)
Tool Calling: Enhancing Medication Consultation via Retrieval-Augmented Large Language Models
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models
by: Basu, Abhinaba, et al.
Published: (2026)
by: Basu, Abhinaba, et al.
Published: (2026)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Tool Calling is Linearly Readable and Steerable in Language Models
by: Wu, Zekun, et al.
Published: (2026)
by: Wu, Zekun, et al.
Published: (2026)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
by: Huang, Shiting, et al.
Published: (2025)
by: Huang, Shiting, et al.
Published: (2025)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
by: Lin, Zihan, et al.
Published: (2025)
by: Lin, Zihan, et al.
Published: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
by: Lai, Yuhang, et al.
Published: (2024)
by: Lai, Yuhang, et al.
Published: (2024)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
by: Liu, Xukun, et al.
Published: (2024)
by: Liu, Xukun, et al.
Published: (2024)
When2Call: When (not) to Call Tools
by: Ross, Hayley, et al.
Published: (2025)
by: Ross, Hayley, et al.
Published: (2025)
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
by: Cheng, Zihao, et al.
Published: (2025)
by: Cheng, Zihao, et al.
Published: (2025)
Agentic Tool Use in Large Language Models
by: Hu, Jinchao, et al.
Published: (2026)
by: Hu, Jinchao, et al.
Published: (2026)
Repairing Tool Calls Using Post-tool Execution Reflection and RAG
by: Tsay, Jason, et al.
Published: (2025)
by: Tsay, Jason, et al.
Published: (2025)
MatTools: Benchmarking Large Language Models for Materials Science Tools
by: Liu, Siyu, et al.
Published: (2025)
by: Liu, Siyu, et al.
Published: (2025)
Large Language Models as Tool Makers
by: Cai, Tianle, et al.
Published: (2023)
by: Cai, Tianle, et al.
Published: (2023)
RM-R1: Reward Modeling as Reasoning
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time
by: Phan, Peter, et al.
Published: (2025)
by: Phan, Peter, et al.
Published: (2025)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
by: Guo, Zhicheng, et al.
Published: (2024)
by: Guo, Zhicheng, et al.
Published: (2024)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
by: Shi, Zhengliang, et al.
Published: (2025)
by: Shi, Zhengliang, et al.
Published: (2025)
Latent Preference Modeling for Cross-Session Personalized Tool Calling
by: Yoon, Yejin, et al.
Published: (2026)
by: Yoon, Yejin, et al.
Published: (2026)
Learning Evolving Tools for Large Language Models
by: Chen, Guoxin, et al.
Published: (2024)
by: Chen, Guoxin, et al.
Published: (2024)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
by: Sun, Mengyuan, et al.
Published: (2026)
by: Sun, Mengyuan, et al.
Published: (2026)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
by: Zhou, Hongli, et al.
Published: (2026)
by: Zhou, Hongli, et al.
Published: (2026)
NesTools: A Dataset for Evaluating Nested Tool Learning Abilities of Large Language Models
by: Han, Han, et al.
Published: (2024)
by: Han, Han, et al.
Published: (2024)
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models
by: Ding, Hanxing, et al.
Published: (2025)
by: Ding, Hanxing, et al.
Published: (2025)
Optimizing Agentic Language Model Inference via Speculative Tool Calls
by: Nichols, Daniel, et al.
Published: (2025)
by: Nichols, Daniel, et al.
Published: (2025)
Similar Items
-
NESTFUL: A Benchmark for Evaluating LLMs on Nested Sequences of API Calls
by: Basu, Kinjal, et al.
Published: (2024) -
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025) -
Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments
by: Crouse, Maxwell, et al.
Published: (2026) -
Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular Tasks
by: Abdelaziz, Ibrahim, et al.
Published: (2024) -
Formally Specifying the High-Level Behavior of LLM-Based Agents
by: Crouse, Maxwell, et al.
Published: (2023)