Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Tang, Yunhao, Wang, Sid, Madaan, Lovish, Munos, Rémi
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!