Ma, Q., Gao, D., Cai, R., Zhao, B., Zhou, H., Zhang, J., & Zhao, Z. (2026). Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization.
Cita Chicago Style (17a ed.)Ma, Qiyao, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, y Zhe Zhao. Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization. 2026.
Cita MLA (9a ed.)Ma, Qiyao, et al. Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization. 2026.
Precaución: Estas citas no son 100% exactas.