Guardado en:
| Autores principales: | Liang, Qiao, Zhu, Yuke, Ge, Chao, Yang, Lei, Shen, Ying, Zheng, Bo, Guo, Sheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.09598 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty
por: Yu, Zewei, et al.
Publicado: (2026)
por: Yu, Zewei, et al.
Publicado: (2026)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025)
por: Wu, Feijie, et al.
Publicado: (2025)
AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
por: Fang, Zhaiyu, et al.
Publicado: (2026)
por: Fang, Zhaiyu, et al.
Publicado: (2026)
Multi-Agent Tool-Integrated Policy Optimization
por: Mo, Zhanfeng, et al.
Publicado: (2025)
por: Mo, Zhanfeng, et al.
Publicado: (2025)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis
por: Zhao, Yufeng, et al.
Publicado: (2025)
por: Zhao, Yufeng, et al.
Publicado: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
por: Ding, Yifeng, et al.
Publicado: (2025)
por: Ding, Yifeng, et al.
Publicado: (2025)
Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning
por: Ma, Qinghe, et al.
Publicado: (2026)
por: Ma, Qinghe, et al.
Publicado: (2026)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
por: Cheng, Qianjia, et al.
Publicado: (2026)
por: Cheng, Qianjia, et al.
Publicado: (2026)
Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
por: Li, Yang, et al.
Publicado: (2025)
por: Li, Yang, et al.
Publicado: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
por: Li, Changming, et al.
Publicado: (2026)
por: Li, Changming, et al.
Publicado: (2026)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
por: He, Yinhan, et al.
Publicado: (2026)
por: He, Yinhan, et al.
Publicado: (2026)
Temporal Consistency for LLM Reasoning Process Error Identification
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
por: He, Yancheng, et al.
Publicado: (2025)
por: He, Yancheng, et al.
Publicado: (2025)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
por: Deng, Jingcheng, et al.
Publicado: (2026)
por: Deng, Jingcheng, et al.
Publicado: (2026)
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
por: Sun, Chung-En, et al.
Publicado: (2026)
por: Sun, Chung-En, et al.
Publicado: (2026)
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
por: Wei, Jiaqi, et al.
Publicado: (2026)
por: Wei, Jiaqi, et al.
Publicado: (2026)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
por: Liang, Xiao, et al.
Publicado: (2025)
por: Liang, Xiao, et al.
Publicado: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Guiding LLM-based Loop Invariant Synthesis via Feedback on Local Reasoning Errors
por: Li, Tianchi, et al.
Publicado: (2026)
por: Li, Tianchi, et al.
Publicado: (2026)
Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
por: Pang, Renning, et al.
Publicado: (2026)
por: Pang, Renning, et al.
Publicado: (2026)
Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
por: Chang, Qikai, et al.
Publicado: (2025)
por: Chang, Qikai, et al.
Publicado: (2025)
Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning
por: Zhang, Dongxu, et al.
Publicado: (2025)
por: Zhang, Dongxu, et al.
Publicado: (2025)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
por: Ko, Yuka, et al.
Publicado: (2024)
por: Ko, Yuka, et al.
Publicado: (2024)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
por: Zhang, Xichen, et al.
Publicado: (2025)
por: Zhang, Xichen, et al.
Publicado: (2025)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025)
por: Wu, Junde, et al.
Publicado: (2025)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
por: Gou, Zhibin, et al.
Publicado: (2023)
por: Gou, Zhibin, et al.
Publicado: (2023)
DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
por: Zhang, Junshuo, et al.
Publicado: (2026)
por: Zhang, Junshuo, et al.
Publicado: (2026)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
por: Lu, Meng, et al.
Publicado: (2025)
por: Lu, Meng, et al.
Publicado: (2025)
NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
por: Zhang, Yulong, et al.
Publicado: (2025)
por: Zhang, Yulong, et al.
Publicado: (2025)
Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning
por: Zhai, Naixin, et al.
Publicado: (2026)
por: Zhai, Naixin, et al.
Publicado: (2026)
Contextual Drag: How Errors in the Context Affect LLM Reasoning
por: Cheng, Yun, et al.
Publicado: (2026)
por: Cheng, Yun, et al.
Publicado: (2026)
ToolDreamer: Instilling LLM Reasoning Into Tool Retrievers
por: Sengupta, Saptarshi, et al.
Publicado: (2025)
por: Sengupta, Saptarshi, et al.
Publicado: (2025)
Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
por: Yang, Runyan, et al.
Publicado: (2025)
por: Yang, Runyan, et al.
Publicado: (2025)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
por: Xu, Ningning, et al.
Publicado: (2025)
por: Xu, Ningning, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Ejemplares similares
-
Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty
por: Yu, Zewei, et al.
Publicado: (2026) -
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025) -
AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
por: Fang, Zhaiyu, et al.
Publicado: (2026) -
Multi-Agent Tool-Integrated Policy Optimization
por: Mo, Zhanfeng, et al.
Publicado: (2025) -
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)