Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Tao, Leitian, Kulikov, Ilia, Saha, Swarnadeep, Wang, Tianlu, Xu, Jing, Li, Sharon, Weston, Jason E, Yu, Ping
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!