Off-Policy Value-Based Reinforcement Learning for Large Language Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wang, Peng-Yuan, Li, Ziniu, Xu, Tian, Yang, Bohan, Liu, Tian-Shuo, Wang, ChenYang, Chen, Xiong-Hui, Li, Yi-Chen, Yang, Tianyun, Chen, Congliang, Yu, Yang
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi