MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wang, Chenglong, Huo, Yifu, Gan, Yang, He, Qiaozhi, Meng, Qi, Li, Bei, Wang, Yan, Liu, Junfu, Zhou, Tianhua, Zhu, Jingbo, Xiao, Tong
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!