On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wu, Yongliang, Zhou, Yizhou, Ziheng, Zhou, Peng, Yingzhe, Ye, Xinyu, Hu, Xinting, Zhu, Wenbo, Qi, Lu, Yang, Ming-Hsuan, Yang, Xu
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!