BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Duan, Kaiwen, Yao, Hongwei, Chen, Yufei, Li, Ziyun, Qiao, Tong, Qin, Zhan, Wang, Cong
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge