Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Kun, Xu, Zenan, Li, Junan, Jin, Zengrui, Deng, Jinghao, Qiu, Zexuan, Zhou, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning
di: Hu, Minda, et al.
Pubblicazione: (2026)
di: Hu, Minda, et al.
Pubblicazione: (2026)
Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework
di: Xu, Zenan, et al.
Pubblicazione: (2025)
di: Xu, Zenan, et al.
Pubblicazione: (2025)
RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
di: Wei, Yifan, et al.
Pubblicazione: (2025)
di: Wei, Yifan, et al.
Pubblicazione: (2025)
TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG
di: Zhang, Tianhua, et al.
Pubblicazione: (2026)
di: Zhang, Tianhua, et al.
Pubblicazione: (2026)
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
di: Zhang, Hang, et al.
Pubblicazione: (2026)
di: Zhang, Hang, et al.
Pubblicazione: (2026)
The Art of Efficient Reasoning: Data, Reward, and Optimization
di: Wu, Taiqiang, et al.
Pubblicazione: (2026)
di: Wu, Taiqiang, et al.
Pubblicazione: (2026)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
di: Ding, Yi, et al.
Pubblicazione: (2026)
di: Ding, Yi, et al.
Pubblicazione: (2026)
LLM Latent Reasoning as Chain of Superposition
di: Deng, Jingcheng, et al.
Pubblicazione: (2025)
di: Deng, Jingcheng, et al.
Pubblicazione: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
di: Lu, Meng, et al.
Pubblicazione: (2025)
di: Lu, Meng, et al.
Pubblicazione: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
Iterative Tree Analysis for Medical Critics
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
di: Wang, Jianing, et al.
Pubblicazione: (2026)
di: Wang, Jianing, et al.
Pubblicazione: (2026)
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
di: He, Bowei, et al.
Pubblicazione: (2026)
di: He, Bowei, et al.
Pubblicazione: (2026)
Purple-teaming LLMs with Adversarial Defender Training
di: Zhou, Jingyan, et al.
Pubblicazione: (2024)
di: Zhou, Jingyan, et al.
Pubblicazione: (2024)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
Efficient Tool Use with Chain-of-Abstraction Reasoning
di: Gao, Silin, et al.
Pubblicazione: (2024)
di: Gao, Silin, et al.
Pubblicazione: (2024)
REARANK: Reasoning Re-ranking Agent via Reinforcement Learning
di: Zhang, Le, et al.
Pubblicazione: (2025)
di: Zhang, Le, et al.
Pubblicazione: (2025)
Faithful Logical Reasoning via Symbolic Chain-of-Thought
di: Xu, Jundong, et al.
Pubblicazione: (2024)
di: Xu, Jundong, et al.
Pubblicazione: (2024)
Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?
di: Zhou, Jingyan, et al.
Pubblicazione: (2023)
di: Zhou, Jingyan, et al.
Pubblicazione: (2023)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
di: Cheng, Qianjia, et al.
Pubblicazione: (2026)
di: Cheng, Qianjia, et al.
Pubblicazione: (2026)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
di: Xing, Shangyu, et al.
Pubblicazione: (2025)
di: Xing, Shangyu, et al.
Pubblicazione: (2025)
MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval
di: Luo, Qi, et al.
Pubblicazione: (2025)
di: Luo, Qi, et al.
Pubblicazione: (2025)
Towards Better RL Training Data Utilization via Second-Order Rollout
di: Yang, Zhe, et al.
Pubblicazione: (2026)
di: Yang, Zhe, et al.
Pubblicazione: (2026)
CoLT: Reasoning with Chain of Latent Tool Calls
di: Zhu, Fangwei, et al.
Pubblicazione: (2026)
di: Zhu, Fangwei, et al.
Pubblicazione: (2026)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
di: Iso, Hayate, et al.
Pubblicazione: (2026)
di: Iso, Hayate, et al.
Pubblicazione: (2026)
Generating Diverse Training Samples for Relation Extraction with Large Language Models
di: Li, Zexuan, et al.
Pubblicazione: (2025)
di: Li, Zexuan, et al.
Pubblicazione: (2025)
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
di: Li, Zexuan, et al.
Pubblicazione: (2025)
di: Li, Zexuan, et al.
Pubblicazione: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR
di: Xu, Haobo, et al.
Pubblicazione: (2026)
di: Xu, Haobo, et al.
Pubblicazione: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
di: Zhang, Luan, et al.
Pubblicazione: (2026)
di: Zhang, Luan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning
di: Hu, Minda, et al.
Pubblicazione: (2026) -
Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework
di: Xu, Zenan, et al.
Pubblicazione: (2025) -
RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
di: Li, Gang, et al.
Pubblicazione: (2025) -
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
di: Wei, Yifan, et al.
Pubblicazione: (2025) -
TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG
di: Zhang, Tianhua, et al.
Pubblicazione: (2026)