Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wen, Xumeng, Liu, Zihan, Zheng, Shun, Ye, Shengyu, Wu, Zhirong, Wang, Yang, Xu, Zhijian, Liang, Xiao, Li, Junjie, Miao, Ziming, Bian, Jiang, Yang, Mao
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!