Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Sareen, Kusha, Moss, Morgane M, Sordoni, Alessandro, Agarwal, Rishabh, Hosseini, Arian
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!