CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Cui, Guofeng, Wang, Pichao, Liu, Yang, Ke, Zemian, Liu, Zhu, Bhat, Vimal
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!