Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Gong, Siyu, Yue, Linan, Gao, Weibo, Yao, Fangzhou, Di, Shimin, Feng, Lei, Zhang, Min-Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Don't Overthink It: A Survey of Efficient R1-style Large Reasoning Models
di: Yue, Linan, et al.
Pubblicazione: (2025)
di: Yue, Linan, et al.
Pubblicazione: (2025)
Cooperative Classification and Rationalization for Graph Generalization
di: Yue, Linan, et al.
Pubblicazione: (2024)
di: Yue, Linan, et al.
Pubblicazione: (2024)
Collaborative Cognitive Diagnosis with Disentangled Representation Learning for Learner Modeling
di: Gao, Weibo, et al.
Pubblicazione: (2024)
di: Gao, Weibo, et al.
Pubblicazione: (2024)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
di: Wang, Yizhi, et al.
Pubblicazione: (2026)
di: Wang, Yizhi, et al.
Pubblicazione: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
Trajectory Supervision for Continual Tool-Use Learning in LLMs
di: Reddy, Vishnu Vardhan, et al.
Pubblicazione: (2026)
di: Reddy, Vishnu Vardhan, et al.
Pubblicazione: (2026)
TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition
di: Kulkarni, Anay, et al.
Pubblicazione: (2026)
di: Kulkarni, Anay, et al.
Pubblicazione: (2026)
Agent4Edu: Generating Learner Response Data by Generative Agents for Intelligent Education Systems
di: Gao, Weibo, et al.
Pubblicazione: (2025)
di: Gao, Weibo, et al.
Pubblicazione: (2025)
ToolRLA: Multiplicative Reward Decomposition for Tool-Integrated Agents
di: Liu, Pengbo
Pubblicazione: (2026)
di: Liu, Pengbo
Pubblicazione: (2026)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
di: Xu, Ningning, et al.
Pubblicazione: (2025)
di: Xu, Ningning, et al.
Pubblicazione: (2025)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
di: Kim, Wonjoong, et al.
Pubblicazione: (2025)
di: Kim, Wonjoong, et al.
Pubblicazione: (2025)
When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?
di: Li, Xinzhe, et al.
Pubblicazione: (2026)
di: Li, Xinzhe, et al.
Pubblicazione: (2026)
RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning
di: Liu, Xiao, et al.
Pubblicazione: (2025)
di: Liu, Xiao, et al.
Pubblicazione: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
di: Xu, Zekun, et al.
Pubblicazione: (2025)
di: Xu, Zekun, et al.
Pubblicazione: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
di: Wu, Feijie, et al.
Pubblicazione: (2025)
di: Wu, Feijie, et al.
Pubblicazione: (2025)
Denoising Programming Knowledge Tracing with a Code Graph-based Tuning Adaptor
di: Gao, Weibo, et al.
Pubblicazione: (2025)
di: Gao, Weibo, et al.
Pubblicazione: (2025)
GraphPrompter: Multi-stage Adaptive Prompt Optimization for Graph In-Context Learning
di: Lv, Rui, et al.
Pubblicazione: (2025)
di: Lv, Rui, et al.
Pubblicazione: (2025)
Intra-Trajectory Consistency for Reward Modeling
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
Tools as Continuous Flow for Evolving Agentic Reasoning
di: Huang, Tairan, et al.
Pubblicazione: (2026)
di: Huang, Tairan, et al.
Pubblicazione: (2026)
When AI reviews science: Can we trust the referee?
di: Wang, Jialiang, et al.
Pubblicazione: (2026)
di: Wang, Jialiang, et al.
Pubblicazione: (2026)
ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use
di: Deng, Mengjie, et al.
Pubblicazione: (2025)
di: Deng, Mengjie, et al.
Pubblicazione: (2025)
Zero-1-to-3: Domain-level Zero-shot Cognitive Diagnosis via One Batch of Early-bird Students towards Three Diagnostic Objectives
di: Gao, Weibo, et al.
Pubblicazione: (2023)
di: Gao, Weibo, et al.
Pubblicazione: (2023)
ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
di: Yang, Chen, et al.
Pubblicazione: (2025)
di: Yang, Chen, et al.
Pubblicazione: (2025)
E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
Understanding Tool-Integrated Reasoning
di: Lin, Heng, et al.
Pubblicazione: (2025)
di: Lin, Heng, et al.
Pubblicazione: (2025)
CAREAgent: Clinical Agent with Structured Reasoning and Tool-Integrated for Order Generation
di: Hou, Ruihui, et al.
Pubblicazione: (2026)
di: Hou, Ruihui, et al.
Pubblicazione: (2026)
CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification
di: Chen, Jinpeng, et al.
Pubblicazione: (2026)
di: Chen, Jinpeng, et al.
Pubblicazione: (2026)
Off-Trajectory Reasoning: Can LLMs Collaborate on Reasoning Trajectory?
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
di: Li, Aochong Oliver, et al.
Pubblicazione: (2025)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
di: Wu, Wenxun, et al.
Pubblicazione: (2025)
di: Wu, Wenxun, et al.
Pubblicazione: (2025)
Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
di: Guo, Ruocheng, et al.
Pubblicazione: (2026)
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
di: Li, Dawei, et al.
Pubblicazione: (2026)
di: Li, Dawei, et al.
Pubblicazione: (2026)
ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
di: Yin, Shaofeng, et al.
Pubblicazione: (2025)
di: Yin, Shaofeng, et al.
Pubblicazione: (2025)
Creative Robot Tool Use by Counterfactual Reasoning
di: Akbulut, M. Tuluhan, et al.
Pubblicazione: (2026)
di: Akbulut, M. Tuluhan, et al.
Pubblicazione: (2026)
MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation
di: Chen, Jianan, et al.
Pubblicazione: (2026)
di: Chen, Jianan, et al.
Pubblicazione: (2026)
ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning
di: Yue, Murong, et al.
Pubblicazione: (2025)
di: Yue, Murong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Don't Overthink It: A Survey of Efficient R1-style Large Reasoning Models
di: Yue, Linan, et al.
Pubblicazione: (2025) -
Cooperative Classification and Rationalization for Graph Generalization
di: Yue, Linan, et al.
Pubblicazione: (2024) -
Collaborative Cognitive Diagnosis with Disentangled Representation Learning for Learner Modeling
di: Gao, Weibo, et al.
Pubblicazione: (2024) -
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
di: He, Pengfei, et al.
Pubblicazione: (2025) -
Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
di: Wang, Yizhi, et al.
Pubblicazione: (2026)