Lin, X., Wen, Y., Su, D., Hou, J., Wang, E., Liu, W., . . . Lv, Z. (2026). Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood.
Chicago-Zitierstil (17. Ausg.)Lin, Xingyu, Yilin Wen, Du Su, Jinchang Hou, En Wang, Wenbin Liu, Chenfu Bao, und Zhonghou Lv. Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood. 2026.
MLA-Zitierstil (9. Ausg.)Lin, Xingyu, et al. Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood. 2026.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.