Fei, W., Kong, H., Liang, S., Lin, Y., Yang, Y., Tang, J., . . . Hua, X. (2025). Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning.
Style de citation Chicago (17e éd.)Fei, Wu, Hao Kong, Shuxian Liang, Yang Lin, Yibo Yang, Jing Tang, Lei Chen, et Xiansheng Hua. Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning. 2025.
Style de citation MLA (9e éd.)Fei, Wu, et al. Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning. 2025.
Attention : ces citations peuvent ne pas être correctes à 100%.