Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yu, Yi, Mingyang, Li, Xiuyu, Fan, Ju, Jiang, Fuxin, Chen, Binbin, Li, Peng, Song, Jie, Zhang, Tieying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation
di: Fan, Meihao, et al.
Pubblicazione: (2026)
di: Fan, Meihao, et al.
Pubblicazione: (2026)
MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
di: Lin, Huawei, et al.
Pubblicazione: (2026)
di: Lin, Huawei, et al.
Pubblicazione: (2026)
ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment
di: Li, Xiuyu, et al.
Pubblicazione: (2026)
di: Li, Xiuyu, et al.
Pubblicazione: (2026)
Epistemic Gain, Aleatoric Cost: Uncertainty Decomposition in Multi-Agent Debate for Math Reasoning
di: Qiao, Dan, et al.
Pubblicazione: (2026)
di: Qiao, Dan, et al.
Pubblicazione: (2026)
HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution
di: Jiang, Dongming, et al.
Pubblicazione: (2026)
di: Jiang, Dongming, et al.
Pubblicazione: (2026)
OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner
di: Jiang, Haoyang, et al.
Pubblicazione: (2026)
di: Jiang, Haoyang, et al.
Pubblicazione: (2026)
RAGEN-2: Reasoning Collapse in Agentic RL
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
DBAIOps: A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
Disentangled Parameter-Efficient Linear Model for Long-Term Time Series Forecasting
di: Zhao, Yuang, et al.
Pubblicazione: (2024)
di: Zhao, Yuang, et al.
Pubblicazione: (2024)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
ToRL: Scaling Tool-Integrated RL
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Learning to Communicate Through Implicit Communication Channels
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Tools as Continuous Flow for Evolving Agentic Reasoning
di: Huang, Tairan, et al.
Pubblicazione: (2026)
di: Huang, Tairan, et al.
Pubblicazione: (2026)
PyVision-RL: Forging Open Agentic Vision Models via RL
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
di: Zhang, Xuqin, et al.
Pubblicazione: (2026)
di: Zhang, Xuqin, et al.
Pubblicazione: (2026)
Online Ensemble Transformer for Accurate Cloud Workload Forecasting in Predictive Auto-Scaling
di: Chen, Jiadong, et al.
Pubblicazione: (2025)
di: Chen, Jiadong, et al.
Pubblicazione: (2025)
Fremer: Lightweight and Effective Frequency Transformer for Workload Forecasting in Cloud Services
di: Chen, Jiadong, et al.
Pubblicazione: (2025)
di: Chen, Jiadong, et al.
Pubblicazione: (2025)
ATFNet: Adaptive Time-Frequency Ensembled Network for Long-term Time Series Forecasting
di: Ye, Hengyu, et al.
Pubblicazione: (2024)
di: Ye, Hengyu, et al.
Pubblicazione: (2024)
On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
di: Liu, Tong, et al.
Pubblicazione: (2026)
di: Liu, Tong, et al.
Pubblicazione: (2026)
Comparing the Decision-Making Mechanisms by Transformers and CNNs via Explanation Methods
di: Jiang, Mingqi, et al.
Pubblicazione: (2022)
di: Jiang, Mingqi, et al.
Pubblicazione: (2022)
Jahn–Teller Effect Induces Exchange Bias in Ultrasmall Magnetite
di: Mengmeng Li, et al.
Pubblicazione: (2026)
di: Mengmeng Li, et al.
Pubblicazione: (2026)
Jahn–Teller Effect Induces Exchange Bias in Ultrasmall Magnetite
di: Mengmeng Li, et al.
Pubblicazione: (2026)
di: Mengmeng Li, et al.
Pubblicazione: (2026)
RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation
di: Zhang, Haobo, et al.
Pubblicazione: (2026)
di: Zhang, Haobo, et al.
Pubblicazione: (2026)
ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning
di: Sun, Esther, et al.
Pubblicazione: (2026)
di: Sun, Esther, et al.
Pubblicazione: (2026)
Object Dynamics Modeling with Hierarchical Point Cloud-based Representations
di: Kim, Chanho, et al.
Pubblicazione: (2024)
di: Kim, Chanho, et al.
Pubblicazione: (2024)
Point-based Instance Completion with Scene Constraints
di: Khademi, Wesley, et al.
Pubblicazione: (2025)
di: Khademi, Wesley, et al.
Pubblicazione: (2025)
MPRM: A Markov Path-based Rule Miner for Efficient and Interpretable Knowledge Graph Reasoning
di: Li, Mingyang, et al.
Pubblicazione: (2025)
di: Li, Mingyang, et al.
Pubblicazione: (2025)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
di: Li, Junbo, et al.
Pubblicazione: (2025)
di: Li, Junbo, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
di: Song, Mingyang, et al.
Pubblicazione: (2025)
di: Song, Mingyang, et al.
Pubblicazione: (2025)
Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
di: Xing, Shuo, et al.
Pubblicazione: (2025)
di: Xing, Shuo, et al.
Pubblicazione: (2025)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
Molecular Lead Optimization via Agentic Tool Planning
di: Li, Lingxiao, et al.
Pubblicazione: (2026)
di: Li, Lingxiao, et al.
Pubblicazione: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
di: Wu, Junde, et al.
Pubblicazione: (2025)
di: Wu, Junde, et al.
Pubblicazione: (2025)
Ultra‐Flat Broadband Low‐Noise Frequency Comb in a Fiber Fabry‐Perot Resonator
di: Tieying Li, et al.
Pubblicazione: (2025)
di: Tieying Li, et al.
Pubblicazione: (2025)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
di: Liu, Shulin, et al.
Pubblicazione: (2025)
di: Liu, Shulin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation
di: Fan, Meihao, et al.
Pubblicazione: (2026) -
MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
di: Lin, Huawei, et al.
Pubblicazione: (2026) -
ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment
di: Li, Xiuyu, et al.
Pubblicazione: (2026) -
Epistemic Gain, Aleatoric Cost: Uncertainty Decomposition in Multi-Agent Debate for Math Reasoning
di: Qiao, Dan, et al.
Pubblicazione: (2026) -
HAGE: Harnessing Agentic Memory via RL-Driven Weighted Graph Evolution
di: Jiang, Dongming, et al.
Pubblicazione: (2026)