Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Xia, Han, Gao, Songyang, Ge, Qiming, Xi, Zhiheng, Zhang, Qi, Huang, Xuanjing
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!