Off-Policy Value-Based Reinforcement Learning for Large Language Models

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Peng-Yuan, Li, Ziniu, Xu, Tian, Yang, Bohan, Liu, Tian-Shuo, Wang, ChenYang, Chen, Xiong-Hui, Li, Yi-Chen, Yang, Tianyun, Chen, Congliang, Yu, Yang
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!