Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Wen, Xumeng, Liu, Zihan, Zheng, Shun, Ye, Shengyu, Wu, Zhirong, Wang, Yang, Xu, Zhijian, Liang, Xiao, Li, Junjie, Miao, Ziming, Bian, Jiang, Yang, Mao
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!