Zhang, Y., Lu, X., Hu, X., Fu, C., Wen, B., Zhang, T., . . . Wang, L. (2025). R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning.
Chicago Style (17th ed.) CitationZhang, Yi-Fan, et al. R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning. 2025.
MLA (9th ed.) CitationZhang, Yi-Fan, et al. R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning. 2025.
Warning: These citations may not always be 100% accurate.