GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zhang, Han, Zheng, Ruibin, Yi, Zexuan, Zhang, Zhuo, Peng, Hanyang, Wang, Hui, Yuan, Zike, Ke, Cai, Chen, Shiwei, Yang, Jiacheng, Li, Yangning, Li, Xiang, Yan, Jiangyue, Liu, Yaoqi, Jing, Liwen, Qi, Jiayin, Xu, Ruifeng, Fang, Binxing, Yu, Yue
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!