From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Jiang, Yuxin, Wang, Yufei, Zhang, Qiyuan, Zeng, Xingshan, Li, Liangyou, Chen, Jierun, Tao, Chaofan, Bai, Haoli, Shang, Lifeng
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!