Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Xu, Yifei, Chakraborty, Tusher, Sharma, Srinagesh, Nunes, Leonardo, Sharma, Swati, Demopulos, Kate Drakos, Kıcıman, Emre, Lu, Songwu, Chandra, Ranveer
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!