Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wen, Xumeng, Liu, Zihan, Zheng, Shun, Ye, Shengyu, Wu, Zhirong, Wang, Yang, Xu, Zhijian, Liang, Xiao, Li, Junjie, Miao, Ziming, Bian, Jiang, Yang, Mao
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!