Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Xixi, Sun, Qianguo, Zhang, Ruiyang, Song, Chao, Wu, Junlong, Qi, Yiyan, Cheng, Hong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
di: Zhang, Ruiyang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
di: Yang, Rui, et al.
Pubblicazione: (2026)
di: Yang, Rui, et al.
Pubblicazione: (2026)
Linear Preference Optimization: Decoupled Gradient Control via Absolute Regularization
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval
di: Wu, Xixi, et al.
Pubblicazione: (2025)
di: Wu, Xixi, et al.
Pubblicazione: (2025)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
di: Bai, Yushi, et al.
Pubblicazione: (2024)
di: Bai, Yushi, et al.
Pubblicazione: (2024)
Scaling Long-Horizon LLM Agent via Context-Folding
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
di: Zhou, Ruiyang, et al.
Pubblicazione: (2025)
di: Zhou, Ruiyang, et al.
Pubblicazione: (2025)
Demystifying Long Chain-of-Thought Reasoning in LLMs
di: Yeo, Edward, et al.
Pubblicazione: (2025)
di: Yeo, Edward, et al.
Pubblicazione: (2025)
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
di: Li, Kuan, et al.
Pubblicazione: (2025)
di: Li, Kuan, et al.
Pubblicazione: (2025)
Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens
di: Clinton, Joseph, et al.
Pubblicazione: (2024)
di: Clinton, Joseph, et al.
Pubblicazione: (2024)
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
di: Ye, Rui, et al.
Pubblicazione: (2025)
di: Ye, Rui, et al.
Pubblicazione: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs
di: Chen, Fu, et al.
Pubblicazione: (2025)
di: Chen, Fu, et al.
Pubblicazione: (2025)
NUM2EVENT: Interpretable Event Reasoning from Numerical time-series
di: Feng, Ninghui, et al.
Pubblicazione: (2025)
di: Feng, Ninghui, et al.
Pubblicazione: (2025)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
di: Wu, Haodong, et al.
Pubblicazione: (2026)
di: Wu, Haodong, et al.
Pubblicazione: (2026)
ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints
di: Choi, Hyeonje, et al.
Pubblicazione: (2026)
di: Choi, Hyeonje, et al.
Pubblicazione: (2026)
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2026)
di: Chen, Ziyang, et al.
Pubblicazione: (2026)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
di: Wang, Zehong, et al.
Pubblicazione: (2026)
di: Wang, Zehong, et al.
Pubblicazione: (2026)
TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training
di: Yang, Jinluan, et al.
Pubblicazione: (2026)
di: Yang, Jinluan, et al.
Pubblicazione: (2026)
Demystifying When Pruning Works via Representation Hierarchies
di: He, Shwai, et al.
Pubblicazione: (2026)
di: He, Shwai, et al.
Pubblicazione: (2026)
Agentless: Demystifying LLM-based Software Engineering Agents
di: Xia, Chunqiu Steven, et al.
Pubblicazione: (2024)
di: Xia, Chunqiu Steven, et al.
Pubblicazione: (2024)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
di: Shen, Junhao, et al.
Pubblicazione: (2026)
di: Shen, Junhao, et al.
Pubblicazione: (2026)
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
di: Wu, Xixi, et al.
Pubblicazione: (2025)
di: Wu, Xixi, et al.
Pubblicazione: (2025)
HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents
di: Yeo, Woongyeng, et al.
Pubblicazione: (2026)
di: Yeo, Woongyeng, et al.
Pubblicazione: (2026)
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
di: Ge, Tao, et al.
Pubblicazione: (2026)
di: Ge, Tao, et al.
Pubblicazione: (2026)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
Recursive Models for Long-Horizon Reasoning
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
di: Wu, Yuhao, et al.
Pubblicazione: (2025)
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
di: Du, He, et al.
Pubblicazione: (2026)
di: Du, He, et al.
Pubblicazione: (2026)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
di: Shi, Taiwei, et al.
Pubblicazione: (2025)
di: Shi, Taiwei, et al.
Pubblicazione: (2025)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
di: Zhang, Ruiyang, et al.
Pubblicazione: (2026) -
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025) -
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
di: Yang, Rui, et al.
Pubblicazione: (2026) -
Linear Preference Optimization: Decoupled Gradient Control via Absolute Regularization
di: Wang, Rui, et al.
Pubblicazione: (2025) -
MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval
di: Wu, Xixi, et al.
Pubblicazione: (2025)