Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Fei, Wu, Kong, Hao, Liang, Shuxian, Lin, Yang, Yang, Yibo, Tang, Jing, Chen, Lei, Hua, Xiansheng
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!