MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Huihui, Nie, Yuanpeng, Wang, Hualiang, Chen, Ying, Li, Wei, Ning, Junzhi, Liu, Lihao, Wang, Hongqiu, Zhu, Lei, Liu, Jiyao, Li, Xiaomeng, He, Junjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
by: Zhang, Mengmeng, et al.
Published: (2026)
by: Zhang, Mengmeng, et al.
Published: (2026)
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
THE-Tree: Can Tracing Historical Evolution Enhance Scientific Verification and Reasoning?
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
by: Liu, Jiyao, et al.
Published: (2025)
by: Liu, Jiyao, et al.
Published: (2025)
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
Open World MRI Reconstruction with Bias-Calibrated Adaptation
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MedAide: Information Fusion and Anatomy of Medical Intents via LLM-based Agent Collaboration
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
Medical Image Spatial Grounding with Semantic Sampling
by: Yu, Andrew Seohwan, et al.
Published: (2026)
by: Yu, Andrew Seohwan, et al.
Published: (2026)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
by: Deng, Ziye, et al.
Published: (2025)
by: Deng, Ziye, et al.
Published: (2025)
Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents
by: Wei, Jinjie, et al.
Published: (2025)
by: Wei, Jinjie, et al.
Published: (2025)
Tri-Plane Mamba: Efficiently Adapting Segment Anything Model for 3D Medical Images
by: Wang, Hualiang, et al.
Published: (2024)
by: Wang, Hualiang, et al.
Published: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
by: Ma, Chenglong, et al.
Published: (2025)
by: Ma, Chenglong, et al.
Published: (2025)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
by: Yue, Jingkun, et al.
Published: (2025)
by: Yue, Jingkun, et al.
Published: (2025)
RetinaLogos: Fine-Grained Synthesis of High-Resolution Retinal Images Through Captions
by: Ning, Junzhi, et al.
Published: (2025)
by: Ning, Junzhi, et al.
Published: (2025)
MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
by: Yang, Guangjing, et al.
Published: (2026)
by: Yang, Guangjing, et al.
Published: (2026)
Multi-modal MRI Translation via Evidential Regression and Distribution Calibration
by: Liu, Jiyao, et al.
Published: (2024)
by: Liu, Jiyao, et al.
Published: (2024)
MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation
by: Wang, Zichun, et al.
Published: (2026)
by: Wang, Zichun, et al.
Published: (2026)
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
by: Ning, Junzhi, et al.
Published: (2026)
by: Ning, Junzhi, et al.
Published: (2026)
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
by: Ma, Wen, et al.
Published: (2026)
by: Ma, Wen, et al.
Published: (2026)
MedHorizon: Towards Long-context Medical Video Understanding in the Wild
by: Du, Bodong, et al.
Published: (2026)
by: Du, Bodong, et al.
Published: (2026)
Escaping the BLEU Trap: A Signal-Grounded Framework with Decoupled Semantic Guidance for EEG-to-Text Decoding
by: Wang, Yuchen, et al.
Published: (2026)
by: Wang, Yuchen, et al.
Published: (2026)
Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
by: Wang, Guoxin, et al.
Published: (2025)
by: Wang, Guoxin, et al.
Published: (2025)
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
by: Su, Yanzhou, et al.
Published: (2025)
by: Su, Yanzhou, et al.
Published: (2025)
Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
MuTri: Multi-view Tri-alignment for OCT to OCTA 3D Image Translation
by: Chen, Zhuangzhuang, et al.
Published: (2025)
by: Chen, Zhuangzhuang, et al.
Published: (2025)
Learning 3D Gaussians for Extremely Sparse-View Cone-Beam CT Reconstruction
by: Lin, Yiqun, et al.
Published: (2024)
by: Lin, Yiqun, et al.
Published: (2024)
Forgetting-Resistant and Lesion-Aware Source-Free Domain Adaptive Fundus Image Analysis with Vision-Language Model
by: Huai, Zheang, et al.
Published: (2026)
by: Huai, Zheang, et al.
Published: (2026)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
by: Bu, Yunhan, et al.
Published: (2026)
by: Bu, Yunhan, et al.
Published: (2026)
Token Activation Map to Visually Explain Multimodal LLMs
by: Li, Yi, et al.
Published: (2025)
by: Li, Yi, et al.
Published: (2025)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
by: Liu, Yuhang, et al.
Published: (2025)
by: Liu, Yuhang, et al.
Published: (2025)
S2-UniSeg: Fast Universal Agglomerative Pooling for Scalable Segment Anything without Supervision
by: Xu, Huihui, et al.
Published: (2025)
by: Xu, Huihui, et al.
Published: (2025)
F^2TTA: Free-Form Test-Time Adaptation on Cross-Domain Medical Image Classification via Image-Level Disentangled Prompt Tuning
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
by: Gao, Jianzhe, et al.
Published: (2026)
by: Gao, Jianzhe, et al.
Published: (2026)
GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis
by: Liu, Yishen, et al.
Published: (2026)
by: Liu, Yishen, et al.
Published: (2026)
A Closer Look at the Explainability of Contrastive Language-Image Pre-training
by: Li, Yi, et al.
Published: (2023)
by: Li, Yi, et al.
Published: (2023)
Learning Unlabeled Clients Divergence for Federated Semi-Supervised Learning via Anchor Model Aggregation
by: Elbatel, Marawan, et al.
Published: (2024)
by: Elbatel, Marawan, et al.
Published: (2024)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
by: Xiong, Yuanhao, et al.
Published: (2023)
by: Xiong, Yuanhao, et al.
Published: (2023)
IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling
by: Zhou, Zhaomeng, et al.
Published: (2026)
by: Zhou, Zhaomeng, et al.
Published: (2026)
Similar Items
-
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
by: Zhang, Mengmeng, et al.
Published: (2026) -
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
by: Liu, Jiyao, et al.
Published: (2026) -
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
by: Liu, Jiyao, et al.
Published: (2026) -
THE-Tree: Can Tracing Historical Evolution Enhance Scientific Verification and Reasoning?
by: Wang, Xin, et al.
Published: (2025) -
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
by: Liu, Jiyao, et al.
Published: (2025)