Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Qianjia, Zhang, Yuchen, Wang, Zhilin, Zuo, Yuxin, Zhang, Shunkai, Fan, Yuchen, Qiao, Yu, Zhou, Bowen, Ding, Ning, Cheng, Yu, Luo, Yun, Cui, Ganqu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Draft-OPD: On-Policy Distillation for Speculative Draft Models
par: Lei, Haodi, et autres
Publié: (2026)
par: Lei, Haodi, et autres
Publié: (2026)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
par: Li, Yafu, et autres
Publié: (2026)
par: Li, Yafu, et autres
Publié: (2026)
Scaling Physical Reasoning with the PHYSICS Dataset
par: Zheng, Shenghe, et autres
Publié: (2025)
par: Zheng, Shenghe, et autres
Publié: (2025)
Characterizing, Evaluating, and Optimizing Complex Reasoning
par: Zhang, Haoran, et autres
Publié: (2026)
par: Zhang, Haoran, et autres
Publié: (2026)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
par: Wang, Zhilin, et autres
Publié: (2026)
par: Wang, Zhilin, et autres
Publié: (2026)
P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads
par: Luo, Yun, et autres
Publié: (2026)
par: Luo, Yun, et autres
Publié: (2026)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
par: Ding, Keyan, et autres
Publié: (2025)
par: Ding, Keyan, et autres
Publié: (2025)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
par: He, Bingxiang, et autres
Publié: (2025)
par: He, Bingxiang, et autres
Publié: (2025)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
par: Xu, Ruotao, et autres
Publié: (2026)
par: Xu, Ruotao, et autres
Publié: (2026)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
par: Lu, Meng, et autres
Publié: (2025)
par: Lu, Meng, et autres
Publié: (2025)
Teaching Language Models to Reason with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
HiPhO: How Far Are (M)LLMs from Humans in the Latest High School Physics Olympiad Benchmark?
par: Yu, Fangchen, et autres
Publié: (2025)
par: Yu, Fangchen, et autres
Publié: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
par: Zhang, Haoji, et autres
Publié: (2025)
par: Zhang, Haoji, et autres
Publié: (2025)
START: Self-taught Reasoner with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
par: Liu, Yifei, et autres
Publié: (2025)
par: Liu, Yifei, et autres
Publié: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
par: Song, Mingyang, et autres
Publié: (2026)
par: Song, Mingyang, et autres
Publié: (2026)
Learning to Reason under Off-Policy Guidance
par: Yan, Jianhao, et autres
Publié: (2025)
par: Yan, Jianhao, et autres
Publié: (2025)
TEMPO: Scaling Test-time Training for Large Reasoning Models
par: Zhang, Qingyang, et autres
Publié: (2026)
par: Zhang, Qingyang, et autres
Publié: (2026)
Understanding Tool-Integrated Reasoning
par: Lin, Heng, et autres
Publié: (2025)
par: Lin, Heng, et autres
Publié: (2025)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
P1: Mastering Physics Olympiads with Reinforcement Learning
par: Chen, Jiacheng, et autres
Publié: (2025)
par: Chen, Jiacheng, et autres
Publié: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
par: Cui, Yu, et autres
Publié: (2025)
par: Cui, Yu, et autres
Publié: (2025)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
par: Lu, Pan, et autres
Publié: (2025)
par: Lu, Pan, et autres
Publié: (2025)
MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Toward Efficient Influence Function: Dropout as a Compression Tool
par: Zhang, Yuchen, et autres
Publié: (2025)
par: Zhang, Yuchen, et autres
Publié: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
par: He, Yang, et autres
Publié: (2026)
par: He, Yang, et autres
Publié: (2026)
Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning
par: Gong, Siyu, et autres
Publié: (2026)
par: Gong, Siyu, et autres
Publié: (2026)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
Thinking Isn't an Illusion: Overcoming the Limitations of Reasoning Models via Tool Augmentations
par: Song, Zhao, et autres
Publié: (2025)
par: Song, Zhao, et autres
Publié: (2025)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
par: Lv, Xingtai, et autres
Publié: (2026)
par: Lv, Xingtai, et autres
Publié: (2026)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
par: Han, Yi, et autres
Publié: (2025)
par: Han, Yi, et autres
Publié: (2025)
CAREAgent: Clinical Agent with Structured Reasoning and Tool-Integrated for Order Generation
par: Hou, Ruihui, et autres
Publié: (2026)
par: Hou, Ruihui, et autres
Publié: (2026)
Teaching Large Reasoning Models Effective Reflection
par: Wang, Hanbin, et autres
Publié: (2026)
par: Wang, Hanbin, et autres
Publié: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
par: Li, Haozhan, et autres
Publié: (2025)
par: Li, Haozhan, et autres
Publié: (2025)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
par: Xu, Ningning, et autres
Publié: (2025)
par: Xu, Ningning, et autres
Publié: (2025)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and Validation
par: Fan, Yuchen, et autres
Publié: (2024)
par: Fan, Yuchen, et autres
Publié: (2024)
Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
par: Chen, Andong, et autres
Publié: (2026)
par: Chen, Andong, et autres
Publié: (2026)
Documents similaires
-
Draft-OPD: On-Policy Distillation for Speculative Draft Models
par: Lei, Haodi, et autres
Publié: (2026) -
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025) -
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
par: Li, Yafu, et autres
Publié: (2026) -
Scaling Physical Reasoning with the PHYSICS Dataset
par: Zheng, Shenghe, et autres
Publié: (2025) -
Characterizing, Evaluating, and Optimizing Complex Reasoning
par: Zhang, Haoran, et autres
Publié: (2026)