SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wan, Zhongwei, Dou, Zhihao, Liu, Che, Zhang, Yu, Cui, Dongfei, Zhao, Qinjian, Shen, Hui, Xiong, Jing, Xin, Yi, Jiang, Yifan, Tao, Chaofan, He, Yangfan, Zhang, Mi, Yan, Shen
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!