Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Jiaxuan, Fu, Wei, Xie, Minyang, Xu, Shusheng, He, Chuyi, Mei, Zhiyu, Zhu, Banghua, Wu, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
von: Fu, Wei, et al.
Veröffentlicht: (2025)
von: Fu, Wei, et al.
Veröffentlicht: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2026)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2026)
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
von: Mei, Zhiyu, et al.
Veröffentlicht: (2023)
von: Mei, Zhiyu, et al.
Veröffentlicht: (2023)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
von: Yan, Ran, et al.
Veröffentlicht: (2025)
von: Yan, Ran, et al.
Veröffentlicht: (2025)
The Effective Horizon Explains Deep RL Performance in Stochastic Environments
von: Laidlaw, Cassidy, et al.
Veröffentlicht: (2023)
von: Laidlaw, Cassidy, et al.
Veröffentlicht: (2023)
Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
von: Xu, Shusheng, et al.
Veröffentlicht: (2024)
von: Xu, Shusheng, et al.
Veröffentlicht: (2024)
How Far Are We from Optimal Reasoning Efficiency?
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
von: Hu, Yue, et al.
Veröffentlicht: (2026)
von: Hu, Yue, et al.
Veröffentlicht: (2026)
AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
von: Kalyan, Vivek, et al.
Veröffentlicht: (2025)
von: Kalyan, Vivek, et al.
Veröffentlicht: (2025)
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
von: Chen, Qianben, et al.
Veröffentlicht: (2026)
von: Chen, Qianben, et al.
Veröffentlicht: (2026)
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
von: Lee, Yoonsang, et al.
Veröffentlicht: (2026)
von: Lee, Yoonsang, et al.
Veröffentlicht: (2026)
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
von: Wu, Xixi, et al.
Veröffentlicht: (2025)
von: Wu, Xixi, et al.
Veröffentlicht: (2025)
Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling
von: Cao, Shijie, et al.
Veröffentlicht: (2026)
von: Cao, Shijie, et al.
Veröffentlicht: (2026)
Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion
von: Lan, Tian, et al.
Veröffentlicht: (2026)
von: Lan, Tian, et al.
Veröffentlicht: (2026)
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
von: Yang, Lu, et al.
Veröffentlicht: (2026)
von: Yang, Lu, et al.
Veröffentlicht: (2026)
Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search
von: Yen, Howard, et al.
Veröffentlicht: (2025)
von: Yen, Howard, et al.
Veröffentlicht: (2025)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
von: Li, Junbo, et al.
Veröffentlicht: (2025)
von: Li, Junbo, et al.
Veröffentlicht: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
von: Guo, Taicheng, et al.
Veröffentlicht: (2025)
von: Guo, Taicheng, et al.
Veröffentlicht: (2025)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
von: Gao, Yuxuan, et al.
Veröffentlicht: (2026)
von: Gao, Yuxuan, et al.
Veröffentlicht: (2026)
NebulaFL: Effective Asynchronous Federated Learning for JointCloud Computing
von: Gao, Fei, et al.
Veröffentlicht: (2024)
von: Gao, Fei, et al.
Veröffentlicht: (2024)
LAGOON: Language-Guided Motion Control
von: Xu, Shusheng, et al.
Veröffentlicht: (2023)
von: Xu, Shusheng, et al.
Veröffentlicht: (2023)
Polar: Agentic RL on Any Harness at Scale
von: Xu, Binfeng, et al.
Veröffentlicht: (2026)
von: Xu, Binfeng, et al.
Veröffentlicht: (2026)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
von: Ning, Xuying, et al.
Veröffentlicht: (2026)
von: Ning, Xuying, et al.
Veröffentlicht: (2026)
Laser: Governing Long-Horizon Agentic Search via Structured Protocol and Context Register
von: Wang, Shuting, et al.
Veröffentlicht: (2025)
von: Wang, Shuting, et al.
Veröffentlicht: (2025)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
von: He, Shuo, et al.
Veröffentlicht: (2026)
von: He, Shuo, et al.
Veröffentlicht: (2026)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
von: Wang, Zhenting, et al.
Veröffentlicht: (2026)
von: Wang, Zhenting, et al.
Veröffentlicht: (2026)
daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
von: Jiang, Mohan, et al.
Veröffentlicht: (2026)
von: Jiang, Mohan, et al.
Veröffentlicht: (2026)
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
von: Zhu, Siqi, et al.
Veröffentlicht: (2026)
von: Zhu, Siqi, et al.
Veröffentlicht: (2026)
Scaling RL to Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
von: Dai, Weinan, et al.
Veröffentlicht: (2026)
von: Dai, Weinan, et al.
Veröffentlicht: (2026)
Compositional Diffusion with Guided Search for Long-Horizon Planning
von: Mishra, Utkarsh A, et al.
Veröffentlicht: (2025)
von: Mishra, Utkarsh A, et al.
Veröffentlicht: (2025)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
von: Zong, Zefang, et al.
Veröffentlicht: (2026)
von: Zong, Zefang, et al.
Veröffentlicht: (2026)
MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks
von: Xu, Yaohang, et al.
Veröffentlicht: (2026)
von: Xu, Yaohang, et al.
Veröffentlicht: (2026)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
von: Li, Ruiying, et al.
Veröffentlicht: (2026)
von: Li, Ruiying, et al.
Veröffentlicht: (2026)
SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs
von: Zhang, Weijia, et al.
Veröffentlicht: (2025)
von: Zhang, Weijia, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
von: Fu, Wei, et al.
Veröffentlicht: (2025) -
On Designing Effective RL Reward at Training Time for LLM Reasoning
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024) -
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2026) -
SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores
von: Mei, Zhiyu, et al.
Veröffentlicht: (2023) -
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
von: Yan, Ran, et al.
Veröffentlicht: (2025)