Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Siyuan, Li, Shiyang, Liu, Xin, Liu, Tianyi, Li, Yixiao, Shi, Zhan, Zhang, Zixuan, Wang, Zilong, Yin, Qingyu, Chen, Jianshu, Zhao, Tuo, Yin, Bing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026)
by: Jiayang, Cheng, et al.
Published: (2026)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025)
by: Lu, Yining, et al.
Published: (2025)
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024)
by: Wang, Kuan, et al.
Published: (2024)
BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models
by: Liu, Liming, et al.
Published: (2026)
by: Liu, Liming, et al.
Published: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
by: Zhang, Qingru, et al.
Published: (2025)
by: Zhang, Qingru, et al.
Published: (2025)
Data Diversity Matters for Robust Instruction Tuning
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
Deep Reinforcement Learning from Hierarchical Preference Design
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
AgenticRec: End-to-End Tool-Integrated Policy Optimization for Ranking-Oriented Recommender Agents
by: Li, Tianyi, et al.
Published: (2026)
by: Li, Tianyi, et al.
Published: (2026)
IHEval: Evaluating Language Models on Following the Instruction Hierarchy
by: Zhang, Zhihan, et al.
Published: (2025)
by: Zhang, Zhihan, et al.
Published: (2025)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
by: Yang, Zuhao, et al.
Published: (2026)
by: Yang, Zuhao, et al.
Published: (2026)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
by: Chen, Aili, et al.
Published: (2026)
by: Chen, Aili, et al.
Published: (2026)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
by: Jiang, Dongfu, et al.
Published: (2025)
by: Jiang, Dongfu, et al.
Published: (2025)
Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use
by: Zhang, Yabo, et al.
Published: (2025)
by: Zhang, Yabo, et al.
Published: (2025)
Agentic Rubrics as Contextual Verifiers for SWE Agents
by: Raghavendra, Mohit, et al.
Published: (2026)
by: Raghavendra, Mohit, et al.
Published: (2026)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
by: Mo, Fengran, et al.
Published: (2026)
by: Mo, Fengran, et al.
Published: (2026)
Pinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement Learning
by: Yin, Junxi, et al.
Published: (2025)
by: Yin, Junxi, et al.
Published: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025)
by: Li, Renhao, et al.
Published: (2025)
ToolGate: Contract-Grounded and Verified Tool Execution for LLMs
by: Liu, Yanming, et al.
Published: (2026)
by: Liu, Yanming, et al.
Published: (2026)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
by: Hong, Ilgee, et al.
Published: (2024)
by: Hong, Ilgee, et al.
Published: (2024)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
by: Tan, Zheyue, et al.
Published: (2025)
by: Tan, Zheyue, et al.
Published: (2025)
6GAgentGym: Tool Use, Data Synthesis, and Agentic Learning for Network Management
by: Chen, Jiao, et al.
Published: (2026)
by: Chen, Jiao, et al.
Published: (2026)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
by: Zhang, Zhen, et al.
Published: (2026)
by: Zhang, Zhen, et al.
Published: (2026)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks
by: Zeng, Yucheng, et al.
Published: (2026)
by: Zeng, Yucheng, et al.
Published: (2026)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
by: Ding, Shengyuan, et al.
Published: (2025)
by: Ding, Shengyuan, et al.
Published: (2025)
A Kernel-Based Nonparametric Test for Conditional Independence of Functional Data
by: Tang, Yin, et al.
Published: (2026)
by: Tang, Yin, et al.
Published: (2026)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
by: Fan, Wei, et al.
Published: (2025)
by: Fan, Wei, et al.
Published: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
by: Li, Chenglin, et al.
Published: (2026)
by: Li, Chenglin, et al.
Published: (2026)
Agentic-R: Learning to Retrieve for Agentic Search
by: Liu, Wenhan, et al.
Published: (2026)
by: Liu, Wenhan, et al.
Published: (2026)
Synthesis of Temporally-Robust Policies for Signal Temporal Logic Tasks using Reinforcement Learning
by: Wang, Siqi, et al.
Published: (2023)
by: Wang, Siqi, et al.
Published: (2023)
Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
by: Hu, Yuelin, et al.
Published: (2026)
by: Hu, Yuelin, et al.
Published: (2026)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
by: Li, Zhuofeng, et al.
Published: (2025)
by: Li, Zhuofeng, et al.
Published: (2025)
Nested Browser-Use Learning for Agentic Information Seeking
by: Li, Baixuan, et al.
Published: (2025)
by: Li, Baixuan, et al.
Published: (2025)
Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection
by: Zhang, Fanrui, et al.
Published: (2025)
by: Zhang, Fanrui, et al.
Published: (2025)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
by: Zeng, Yirong, et al.
Published: (2025)
by: Zeng, Yirong, et al.
Published: (2025)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
by: Huang, Yue, et al.
Published: (2023)
by: Huang, Yue, et al.
Published: (2023)
MEMORYLLM: Towards Self-Updatable Large Language Models
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning
by: Chen, Liuji, et al.
Published: (2026)
by: Chen, Liuji, et al.
Published: (2026)
Similar Items
-
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026) -
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025) -
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024) -
BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models
by: Liu, Liming, et al.
Published: (2026) -
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
by: Zhang, Qingru, et al.
Published: (2025)