Zhao, Y., Bai, H., & Zhao, X. (2025). GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO.
Chicago-Zitierstil (17. Ausg.)Zhao, Yiyang, Huiyu Bai, und Xuejiao Zhao. GFRIEND: Generative Few-shot Reward Inference Through EfficieNt DPO. 2025.
MLA-Zitierstil (9. Ausg.)Zhao, Yiyang, et al. GFRIEND: Generative Few-shot Reward Inference Through EfficieNt DPO. 2025.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.