GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Su, Yanzhou, Li, Tianbin, Liu, Jiyao, Ma, Chenglong, Ning, Junzhi, Tang, Cheng, Ju, Sibo, Ye, Jin, Chen, Pengcheng, Hu, Ming, Tang, Shixiang, Liu, Lihao, Fu, Bin, Shao, Wenqi, Hu, Xiaowei, Liao, Xiangwen, Ji, Yuanfeng, He, Junjun
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866915223902879744
author Su, Yanzhou
Li, Tianbin
Liu, Jiyao
Ma, Chenglong
Ning, Junzhi
Tang, Cheng
Ju, Sibo
Ye, Jin
Chen, Pengcheng
Hu, Ming
Tang, Shixiang
Liu, Lihao
Fu, Bin
Shao, Wenqi
Hu, Xiaowei
Liao, Xiangwen
Ji, Yuanfeng
He, Junjun
author_facet Su, Yanzhou
Li, Tianbin
Liu, Jiyao
Ma, Chenglong
Ning, Junzhi
Tang, Cheng
Ju, Sibo
Ye, Jin
Chen, Pengcheng
Hu, Ming
Tang, Shixiang
Liu, Lihao
Fu, Bin
Shao, Wenqi
Hu, Xiaowei
Liao, Xiangwen
Ji, Yuanfeng
He, Junjun
contents Recent advances in general medical AI have made significant strides, but existing models often lack the reasoning capabilities needed for complex medical decision-making. This paper presents GMAI-VL-R1, a multimodal medical reasoning model enhanced by reinforcement learning (RL) to improve its reasoning abilities. Through iterative training, GMAI-VL-R1 optimizes decision-making, significantly boosting diagnostic accuracy and clinical support. We also develop a reasoning data synthesis method, generating step-by-step reasoning data via rejection sampling, which further enhances the model's generalization. Experimental results show that after RL training, GMAI-VL-R1 excels in tasks such as medical image diagnosis and visual question answering. While the model demonstrates basic memorization with supervised fine-tuning, RL is crucial for true generalization. Our work establishes new evaluation benchmarks and paves the way for future advancements in medical reasoning models. Code, data, and model will be released at \href{https://github.com/uni-medical/GMAI-VL-R1}{this link}.
format Preprint
id arxiv_https___arxiv_org_abs_2504_01886
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
Su, Yanzhou
Li, Tianbin
Liu, Jiyao
Ma, Chenglong
Ning, Junzhi
Tang, Cheng
Ju, Sibo
Ye, Jin
Chen, Pengcheng
Hu, Ming
Tang, Shixiang
Liu, Lihao
Fu, Bin
Shao, Wenqi
Hu, Xiaowei
Liao, Xiangwen
Ji, Yuanfeng
He, Junjun
Computer Vision and Pattern Recognition
Recent advances in general medical AI have made significant strides, but existing models often lack the reasoning capabilities needed for complex medical decision-making. This paper presents GMAI-VL-R1, a multimodal medical reasoning model enhanced by reinforcement learning (RL) to improve its reasoning abilities. Through iterative training, GMAI-VL-R1 optimizes decision-making, significantly boosting diagnostic accuracy and clinical support. We also develop a reasoning data synthesis method, generating step-by-step reasoning data via rejection sampling, which further enhances the model's generalization. Experimental results show that after RL training, GMAI-VL-R1 excels in tasks such as medical image diagnosis and visual question answering. While the model demonstrates basic memorization with supervised fine-tuning, RL is crucial for true generalization. Our work establishes new evaluation benchmarks and paves the way for future advancements in medical reasoning models. Code, data, and model will be released at \href{https://github.com/uni-medical/GMAI-VL-R1}{this link}.
title GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2504.01886