Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Sun, Shengyang, Zhang, Yian, Bukharin, Alexander, Mosallanezhad, David, Zeng, Jiaqi, Singhal, Soumye, Shen, Gerald, Renduchintala, Adithya, Konuk, Tugrul, Dong, Yi, Wang, Zhilin, Chichkov, Dmitry, Delalleau, Olivier, Kuchaiev, Oleksii
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!