Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Fei, Wu, Kong, Hao, Liang, Shuxian, Lin, Yang, Yang, Yibo, Tang, Jing, Chen, Lei, Hua, Xiansheng
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!