DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Qiying, Zhang, Zheng, Zhu, Ruofei, Yuan, Yufeng, Zuo, Xiaochen, Yue, Yu, Dai, Weinan, Fan, Tiantian, Liu, Gaohong, Liu, Lingjun, Liu, Xin, Lin, Haibin, Lin, Zhiqi, Ma, Bole, Sheng, Guangming, Tong, Yuxuan, Zhang, Chi, Zhang, Mofan, Zhang, Wang, Zhu, Hang, Zhu, Jinhua, Chen, Jiaze, Chen, Jiangjie, Wang, Chengyi, Yu, Hongli, Song, Yuxuan, Wei, Xiangpeng, Zhou, Hao, Liu, Jingjing, Ma, Wei-Ying, Zhang, Ya-Qin, Yan, Lin, Qiao, Mu, Wu, Yonghui, Wang, Mingxuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
by: Yue, Yu, et al.
Published: (2025)
by: Yue, Yu, et al.
Published: (2025)
Truncated Proximal Policy Optimization
by: Fan, Tiantian, et al.
Published: (2025)
by: Fan, Tiantian, et al.
Published: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
by: Yu, Hongli, et al.
Published: (2025)
by: Yu, Hongli, et al.
Published: (2025)
ShortListing Model: A Streamlined SimplexDiffusion for Discrete Variable Generation
by: Song, Yuxuan, et al.
Published: (2025)
by: Song, Yuxuan, et al.
Published: (2025)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
by: Chen, Jiangjie, et al.
Published: (2025)
by: Chen, Jiangjie, et al.
Published: (2025)
Determining the Minimum Number of Examined Lymph Nodes for N1b Papillary Thyroid Cancer Patients
by: Liu Xiao, et al.
Published: (2025)
by: Liu Xiao, et al.
Published: (2025)
A Survey on Diffusion Models for Recommender Systems
by: Lin, Jianghao, et al.
Published: (2024)
by: Lin, Jianghao, et al.
Published: (2024)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
by: Dai, Weinan, et al.
Published: (2026)
by: Dai, Weinan, et al.
Published: (2026)
Superplatforms Have to Attack AI Agents
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
End-to-end 2D-3D Registration between Image and LiDAR Point Cloud for Vehicle Localization
by: Wang, Guangming, et al.
Published: (2023)
by: Wang, Guangming, et al.
Published: (2023)
Centralizers, Clifforders, Polynomial Equivalence and $ω$-equivalence of Matrices
by: Zhang, Hechun, et al.
Published: (2025)
by: Zhang, Hechun, et al.
Published: (2025)
A New DAPO Algorithm for Stock Trading
by: Zha, Ruijian, et al.
Published: (2025)
by: Zha, Ruijian, et al.
Published: (2025)
Securing Operating Systems Through Fine-grained Kernel Access Limitation for IoT Systems
by: Zhan, Dongyang, et al.
Published: (2025)
by: Zhan, Dongyang, et al.
Published: (2025)
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
by: Xi, Yunjia, et al.
Published: (2024)
by: Xi, Yunjia, et al.
Published: (2024)
A mini-batch training strategy for deep subspace clustering networks
by: Jiang, Yuxuan, et al.
Published: (2025)
by: Jiang, Yuxuan, et al.
Published: (2025)
TEASER: Token Enhanced Spatial Modeling for Expressions Reconstruction
by: Liu, Yunfei, et al.
Published: (2025)
by: Liu, Yunfei, et al.
Published: (2025)
Direct Production of Light Scalar in the Type-I Two-Higgs-Doublet Model at the Lifetime Frontier of LHC
by: Liu, Wei, et al.
Published: (2024)
by: Liu, Wei, et al.
Published: (2024)
M-scan: A Multi-Scenario Causal-driven Adaptive Network for Recommendation
by: Zhu, Jiachen, et al.
Published: (2024)
by: Zhu, Jiachen, et al.
Published: (2024)
When marine radar target detection meets pretrained large language models
by: Hu, Qiying, et al.
Published: (2025)
by: Hu, Qiying, et al.
Published: (2025)
Atomic‐to‐Nanoscale Cerium Engineering Enables Synergistic Dual‐Phase Electrodes for High‐Performance Reversible Protonic Ceramic Cells
by: Jianqiu Zhu, et al.
Published: (2025)
by: Jianqiu Zhu, et al.
Published: (2025)
Adding Alignment Control to Language Models
by: Zhu, Wenhong, et al.
Published: (2025)
by: Zhu, Wenhong, et al.
Published: (2025)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
by: Li, Yuxuan, et al.
Published: (2026)
by: Li, Yuxuan, et al.
Published: (2026)
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
ProtoGCD: Unified and Unbiased Prototype Learning for Generalized Category Discovery
by: Ma, Shijie, et al.
Published: (2025)
by: Ma, Shijie, et al.
Published: (2025)
Ropivacaine synergizes with sorafenib to induce apoptosis of hepatocellular carcinoma cells via the IL‐6/STAT3 pathway
by: Wenting Wang, et al.
Published: (2024)
by: Wenting Wang, et al.
Published: (2024)
Adaptive Milestone Reward for GUI Agents
by: Zheng, Congmin, et al.
Published: (2026)
by: Zheng, Congmin, et al.
Published: (2026)
Symbol-Level Precoding for Integrated Sensing and Covert Communication
by: Wang, Yufei, et al.
Published: (2025)
by: Wang, Yufei, et al.
Published: (2025)
Engineered Silicon Avalanche Photodetectors: Mechanisms and Performance Optimization
by: Kaicheng Liu, et al.
Published: (2026)
by: Kaicheng Liu, et al.
Published: (2026)
Simulation as Reality? The Effectiveness of LLM-Generated Data in Open-ended Question Assessment
by: Zhang, Long, et al.
Published: (2025)
by: Zhang, Long, et al.
Published: (2025)
Nonlinear self-interaction induced black hole bomb
by: Zhang, Cheng-Yong, et al.
Published: (2023)
by: Zhang, Cheng-Yong, et al.
Published: (2023)
The Twisting of Radio Waves in a Randomly Inhomogeneous Plasma
by: Zhang, Ze-Lin, et al.
Published: (2024)
by: Zhang, Ze-Lin, et al.
Published: (2024)
Learning Hamiltonian neural Koopman operator and simultaneously sustaining and discovering conservation law
by: Zhang, Jingdong, et al.
Published: (2024)
by: Zhang, Jingdong, et al.
Published: (2024)
Strong Dipole Moments and Increased Charge Transfer in Polymer‐Based Solid Electrolyte Enable Wide‐Temperature Solid‐State Lithium Metal Batteries
by: Weizhong Liang, et al.
Published: (2025)
by: Weizhong Liang, et al.
Published: (2025)
Multi-modal Evidential Fusion Network for Trustworthy PET/CT Tumor Segmentation
by: Qi, Yuxuan, et al.
Published: (2024)
by: Qi, Yuxuan, et al.
Published: (2024)
What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret
by: Yuan, Yufeng, et al.
Published: (2025)
by: Yuan, Yufeng, et al.
Published: (2025)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
by: Ma, Chi, et al.
Published: (2024)
by: Ma, Chi, et al.
Published: (2024)
PEPA: a Persistently Autonomous Embodied Agent with Personalities
by: Liu, Kaige, et al.
Published: (2026)
by: Liu, Kaige, et al.
Published: (2026)
Multi‐event‐triggered adaptive dynamic programming for non‐zero‐sum game of unknown nonlinear system
by: Qi Zhu, et al.
Published: (2024)
by: Qi Zhu, et al.
Published: (2024)
Global well-posedness and enhanced dissipation for the 2D stochastic Nernst-Planck-Navier-Stokes equations with transport noise
by: Lin, Quyuan, et al.
Published: (2024)
by: Lin, Quyuan, et al.
Published: (2024)
Similar Items
-
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
by: Yue, Yu, et al.
Published: (2025) -
Truncated Proximal Policy Optimization
by: Fan, Tiantian, et al.
Published: (2025) -
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
by: Yu, Hongli, et al.
Published: (2025) -
ShortListing Model: A Streamlined SimplexDiffusion for Discrete Variable Generation
by: Song, Yuxuan, et al.
Published: (2025) -
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
by: Chen, Jiangjie, et al.
Published: (2025)