Jang, J., Kim, J., Baek, K., & Kwak, N. (2025). Multi-dimensional Preference Alignment by Conditioning Reward Itself.
Cita Chicago Style (17a ed.)Jang, Jiho, Jinyoung Kim, Kyungjune Baek, y Nojun Kwak. Multi-dimensional Preference Alignment by Conditioning Reward Itself. 2025.
Cita MLA (9a ed.)Jang, Jiho, et al. Multi-dimensional Preference Alignment by Conditioning Reward Itself. 2025.
Precaución: Estas citas no son 100% exactas.