BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yubao, Huang, Weiquan, Wang, Sudong, Zhao, Ruochen, Chen, Chen, Shu, Yao, Qin, Chengwei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Lifelong Event Detection with Embedding Space Separation and Compaction
by: Qin, Chengwei, et al.
Published: (2024)
by: Qin, Chengwei, et al.
Published: (2024)
ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation
by: Xu, Bo, et al.
Published: (2026)
by: Xu, Bo, et al.
Published: (2026)
Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems
by: Lin, Hehai, et al.
Published: (2026)
by: Lin, Hehai, et al.
Published: (2026)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
by: Wang, Daoyu, et al.
Published: (2026)
by: Wang, Daoyu, et al.
Published: (2026)
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
by: Lee, Yoonsang, et al.
Published: (2026)
by: Lee, Yoonsang, et al.
Published: (2026)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
by: Wang, Sudong, et al.
Published: (2026)
by: Wang, Sudong, et al.
Published: (2026)
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
by: Wu, Jinyang, et al.
Published: (2026)
by: Wu, Jinyang, et al.
Published: (2026)
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
by: Ye, Juexiang, et al.
Published: (2026)
by: Ye, Juexiang, et al.
Published: (2026)
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
by: Chen, Qianben, et al.
Published: (2026)
by: Chen, Qianben, et al.
Published: (2026)
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
by: Chu, Zheng, et al.
Published: (2026)
by: Chu, Zheng, et al.
Published: (2026)
Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs
by: Ling Team, et al.
Published: (2025)
by: Ling Team, et al.
Published: (2025)
Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion
by: Lan, Tian, et al.
Published: (2026)
by: Lan, Tian, et al.
Published: (2026)
Toward Autonomous Long-Horizon Engineering for ML Research
by: Chen, Guoxin, et al.
Published: (2026)
by: Chen, Guoxin, et al.
Published: (2026)
ChatGPT's One-year Anniversary: Are Open-Source Large Language Models Catching up?
by: Chen, Hailin, et al.
Published: (2023)
by: Chen, Hailin, et al.
Published: (2023)
Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search
by: Yen, Howard, et al.
Published: (2025)
by: Yen, Howard, et al.
Published: (2025)
Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
by: Wu, Haotian, et al.
Published: (2025)
by: Wu, Haotian, et al.
Published: (2025)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
by: Ravaut, Mathieu, et al.
Published: (2024)
by: Ravaut, Mathieu, et al.
Published: (2024)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
by: Wu, Jiaqi, et al.
Published: (2025)
by: Wu, Jiaqi, et al.
Published: (2025)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
by: Zhang, Qi, et al.
Published: (2026)
by: Zhang, Qi, et al.
Published: (2026)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
by: Kalyan, Vivek, et al.
Published: (2025)
by: Kalyan, Vivek, et al.
Published: (2025)
Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges
by: Ding, Bosheng, et al.
Published: (2024)
by: Ding, Bosheng, et al.
Published: (2024)
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
by: Wu, Haotian, et al.
Published: (2025)
by: Wu, Haotian, et al.
Published: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
by: Wang, Jianing, et al.
Published: (2026)
by: Wang, Jianing, et al.
Published: (2026)
AgREE: Agentic Reasoning for Knowledge Graph Completion on Emerging Entities
by: Zhao, Ruochen, et al.
Published: (2025)
by: Zhao, Ruochen, et al.
Published: (2025)
GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering
by: Sun, Xin, et al.
Published: (2026)
by: Sun, Xin, et al.
Published: (2026)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
by: Shen, Junhao, et al.
Published: (2026)
by: Shen, Junhao, et al.
Published: (2026)
Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
by: Lumer, Elias, et al.
Published: (2026)
by: Lumer, Elias, et al.
Published: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025)
by: Liu, Xiaoqian, et al.
Published: (2025)
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
by: Cao, Qian, et al.
Published: (2026)
by: Cao, Qian, et al.
Published: (2026)
In-Context Learning with Iterative Demonstration Selection
by: Qin, Chengwei, et al.
Published: (2023)
by: Qin, Chengwei, et al.
Published: (2023)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
by: Zhang, Yinger, et al.
Published: (2026)
by: Zhang, Yinger, et al.
Published: (2026)
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
by: Zeng, Yu, et al.
Published: (2025)
by: Zeng, Yu, et al.
Published: (2025)
ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
by: Mei, Jingbiao, et al.
Published: (2025)
by: Mei, Jingbiao, et al.
Published: (2025)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
by: Li, Ruiying, et al.
Published: (2026)
by: Li, Ruiying, et al.
Published: (2026)
LiPO: Listwise Preference Optimization through Learning-to-Rank
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
by: Hu, Ziyou, et al.
Published: (2025)
by: Hu, Ziyou, et al.
Published: (2025)
Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching
by: Wei, Rongzhe, et al.
Published: (2026)
by: Wei, Rongzhe, et al.
Published: (2026)
CARL: Criticality-Aware Agentic Reinforcement Learning
by: Shen, Leyang, et al.
Published: (2025)
by: Shen, Leyang, et al.
Published: (2025)
Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design
by: Chen, Shengchao, et al.
Published: (2026)
by: Chen, Shengchao, et al.
Published: (2026)
Similar Items
-
Lifelong Event Detection with Embedding Space Separation and Compaction
by: Qin, Chengwei, et al.
Published: (2024) -
ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation
by: Xu, Bo, et al.
Published: (2026) -
Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems
by: Lin, Hehai, et al.
Published: (2026) -
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
by: Wang, Daoyu, et al.
Published: (2026) -
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
by: Lee, Yoonsang, et al.
Published: (2026)