Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Anglin, Chen, Ruichao, Lu, Yi, Xu, Hongxia, Chen, Jintai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedSAM3: Delving into Segment Anything with Medical Concepts
par: Liu, Anglin, et autres
Publié: (2025)
par: Liu, Anglin, et autres
Publié: (2025)
Multi-rater Prompting for Ambiguous Medical Image Segmentation
par: Wang, Jinhong, et autres
Publié: (2024)
par: Wang, Jinhong, et autres
Publié: (2024)
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
par: Chen, Jiahe, et autres
Publié: (2025)
par: Chen, Jiahe, et autres
Publié: (2025)
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
par: Wang, Jinhong, et autres
Publié: (2025)
par: Wang, Jinhong, et autres
Publié: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
par: Liu, Jiyao, et autres
Publié: (2025)
par: Liu, Jiyao, et autres
Publié: (2025)
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Tail-Aware Post-Training Quantization for 3D Geometry Models
par: Pan, Sicheng, et autres
Publié: (2026)
par: Pan, Sicheng, et autres
Publié: (2026)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
par: Bao, Zhijie, et autres
Publié: (2026)
par: Bao, Zhijie, et autres
Publié: (2026)
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
par: Qin, Zheng, et autres
Publié: (2025)
par: Qin, Zheng, et autres
Publié: (2025)
MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis
par: Zhang, Yuting, et autres
Publié: (2025)
par: Zhang, Yuting, et autres
Publié: (2025)
SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment
par: Zhao, Weiren, et autres
Publié: (2026)
par: Zhao, Weiren, et autres
Publié: (2026)
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
par: Liu, Jiyao, et autres
Publié: (2026)
par: Liu, Jiyao, et autres
Publié: (2026)
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
par: Liu, Jiyao, et autres
Publié: (2026)
par: Liu, Jiyao, et autres
Publié: (2026)
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
par: Shi, Baorong, et autres
Publié: (2026)
par: Shi, Baorong, et autres
Publié: (2026)
Law of Vision Representation in MLLMs
par: Yang, Shijia, et autres
Publié: (2024)
par: Yang, Shijia, et autres
Publié: (2024)
Training-Free Reasoning and Reflection in MLLMs
par: Wei, Hongchen, et autres
Publié: (2025)
par: Wei, Hongchen, et autres
Publié: (2025)
Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs
par: Sun, Yanpeng, et autres
Publié: (2025)
par: Sun, Yanpeng, et autres
Publié: (2025)
MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration
par: Peng, Jiahui, et autres
Publié: (2026)
par: Peng, Jiahui, et autres
Publié: (2026)
MedFlowSeg: Flow Matching for Medical Image Segmentation with Frequency-Aware Attention
par: Chen, Zhi, et autres
Publié: (2026)
par: Chen, Zhi, et autres
Publié: (2026)
Self-Aware Adaptive Alignment: Enabling Accurate Perception for Intelligent Transportation Systems
par: Xiang, Tong, et autres
Publié: (2025)
par: Xiang, Tong, et autres
Publié: (2025)
LKM-UNet: Large Kernel Vision Mamba UNet for Medical Image Segmentation
par: Wang, Jinhong, et autres
Publié: (2024)
par: Wang, Jinhong, et autres
Publié: (2024)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
FreeRet: MLLMs as Training-Free Retrievers
par: Zhu, Yuhan, et autres
Publié: (2025)
par: Zhu, Yuhan, et autres
Publié: (2025)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
par: Chen, Feng, et autres
Publié: (2025)
par: Chen, Feng, et autres
Publié: (2025)
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
par: Lu, Junxin, et autres
Publié: (2026)
par: Lu, Junxin, et autres
Publié: (2026)
SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
par: Shu, Fangxun, et autres
Publié: (2025)
par: Shu, Fangxun, et autres
Publié: (2025)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration
par: Zhang, Chenran, et autres
Publié: (2026)
par: Zhang, Chenran, et autres
Publié: (2026)
Landscape-Awareness for Geometric View Diffusion Model
par: Chen, Yan-Ting, et autres
Publié: (2026)
par: Chen, Yan-Ting, et autres
Publié: (2026)
Linking Perception, Confidence and Accuracy in MLLMs
par: Du, Yuetian, et autres
Publié: (2026)
par: Du, Yuetian, et autres
Publié: (2026)
Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
par: Li, Zhiheng, et autres
Publié: (2026)
par: Li, Zhiheng, et autres
Publié: (2026)
Sensitivity-Aware Post-Training Quantization for Deep Neural Networks
par: Zheng, Zekang, et autres
Publié: (2025)
par: Zheng, Zekang, et autres
Publié: (2025)
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
par: Chen, Qiuhui, et autres
Publié: (2024)
par: Chen, Qiuhui, et autres
Publié: (2024)
Med-TTT: Vision Test-Time Training model for Medical Image Segmentation
par: Xu, Jiashu
Publié: (2024)
par: Xu, Jiashu
Publié: (2024)
Outlier-Aware Post-Training Quantization for Image Super-Resolution
par: Wang, Hailing, et autres
Publié: (2025)
par: Wang, Hailing, et autres
Publié: (2025)
MedVeriSeg: Teaching MLLM-Based Medical Segmentation Models to Verify Query Validity Without Extra Training
par: Lu, Ziqian, et autres
Publié: (2026)
par: Lu, Ziqian, et autres
Publié: (2026)
MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation
par: Li, Gengliang, et autres
Publié: (2025)
par: Li, Gengliang, et autres
Publié: (2025)
OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM
par: Wang, Jinhong, et autres
Publié: (2025)
par: Wang, Jinhong, et autres
Publié: (2025)
Enhancing Scene Transition Awareness in Video Generation via Post-Training
par: Shen, Hanwen, et autres
Publié: (2025)
par: Shen, Hanwen, et autres
Publié: (2025)
Documents similaires
-
MedSAM3: Delving into Segment Anything with Medical Concepts
par: Liu, Anglin, et autres
Publié: (2025) -
Multi-rater Prompting for Ambiguous Medical Image Segmentation
par: Wang, Jinhong, et autres
Publié: (2024) -
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
par: Chen, Jiahe, et autres
Publié: (2025) -
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
par: Wang, Jinhong, et autres
Publié: (2025) -
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
par: Liu, Jiyao, et autres
Publié: (2025)