R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhang, Yi-Fan, Lu, Xingyu, Hu, Xiao, Fu, Chaoyou, Wen, Bin, Zhang, Tianke, Liu, Changyi, Jiang, Kaiyu, Chen, Kaibing, Tang, Kaiyu, Ding, Haojie, Chen, Jiankang, Yang, Fan, Zhang, Zhang, Gao, Tingting, Wang, Liang
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!