BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Xi, Zhiheng, Guo, Xin, Nan, Yang, Zhou, Enyu, Shen, Junrui, Chen, Wenxiang, Liu, Jiaqi, Huang, Jixuan, Zhang, Zhihao, Guo, Honglin, Deng, Xun, Lei, Zhikai, Zheng, Miao, Wang, Guoteng, Zhang, Shuo, Sun, Peng, Zheng, Rui, Yan, Hang, Gui, Tao, Zhang, Qi, Huang, Xuanjing
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!