BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Duan, Kaiwen, Yao, Hongwei, Chen, Yufei, Li, Ziyun, Qiao, Tong, Qin, Zhan, Wang, Cong
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!