Wu, J., Wang, X., Yang, Z., Wu, J., Gao, J., Ding, B., . . . He, X. (2024). AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.
Style de citation Chicago (17e éd.)Wu, Junkang, Xue Wang, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, et Xiangnan He. AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization. 2024.
Style de citation MLA (9e éd.)Wu, Junkang, et al. AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization. 2024.
Attention : ces citations peuvent ne pas être correctes à 100%.