Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Lin, Xingyu, Wen, Yilin, Wang, En, Su, Du, Liu, Wenbin, Bao, Chenfu, Lv, Zhonghou
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!