VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zhu, Dingwei, Dou, Shihan, Xi, Zhiheng, Jin, Senjie, Zhang, Guoqiang, Zhang, Jiazheng, Ye, Junjie, Chai, Mingxu, Zhou, Enyu, Zhang, Ming, Huang, Caishuang, Zhang, Yunke, Wang, Yuran, Gui, Tao
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!