SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wan, Zhongwei, Dou, Zhihao, Liu, Che, Zhang, Yu, Cui, Dongfei, Zhao, Qinjian, Shen, Hui, Xiong, Jing, Xin, Yi, Jiang, Yifan, Tao, Chaofan, He, Yangfan, Zhang, Mi, Yan, Shen
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!