How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Guimeng, Yu, Tianze, Ebrahimkhani, Somayeh, Shawn, Lin Zhi Zheng, Ng, Kok Pin, Cheung, Ngai-Man |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Brain‐FM: A Multimodal Foundation Model for Visual Question Answering in Brain Health Diagnostics
par: Somayeh Ebrahimkhani, et autres
Publié: (2025)
par: Somayeh Ebrahimkhani, et autres
Publié: (2025)
AIR: Zero-shot Generative Model Adaptation with Iterative Refinement
par: Liu, Guimeng, et autres
Publié: (2025)
par: Liu, Guimeng, et autres
Publié: (2025)
Vision Transformer Neural Architecture Search for Out-of-Distribution Generalization: Benchmark and Insights
par: Ho, Sy-Tuyen, et autres
Publié: (2025)
par: Ho, Sy-Tuyen, et autres
Publié: (2025)
A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot
par: Abdollahzadeh, Milad, et autres
Publié: (2023)
par: Abdollahzadeh, Milad, et autres
Publié: (2023)
Text to Image Generation and Editing: A Survey
par: Yang, Pengfei, et autres
Publié: (2025)
par: Yang, Pengfei, et autres
Publié: (2025)
On the Adversarial Robustness of 3D Large Vision-Language Models
par: Liu, Chao, et autres
Publié: (2026)
par: Liu, Chao, et autres
Publié: (2026)
Token Compression Meets Compact Vision Transformers: A Survey and Comparative Evaluation for Edge AI
par: Nguyen, Phat, et autres
Publié: (2025)
par: Nguyen, Phat, et autres
Publié: (2025)
Frequency Masking for Universal Deepfake Detection
par: Doloriel, Chandler Timm, et autres
Publié: (2024)
par: Doloriel, Chandler Timm, et autres
Publié: (2024)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
par: Kim, Jiwan, et autres
Publié: (2026)
par: Kim, Jiwan, et autres
Publié: (2026)
Urban Air Temperature Prediction using Conditional Diffusion Models
par: Dai, Siyang, et autres
Publié: (2024)
par: Dai, Siyang, et autres
Publié: (2024)
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
When CNN Meet with ViT: Towards Semi-Supervised Learning for Multi-Class Medical Image Semantic Segmentation
par: Wang, Ziyang, et autres
Publié: (2022)
par: Wang, Ziyang, et autres
Publié: (2022)
Medical Image Spatial Grounding with Semantic Sampling
par: Yu, Andrew Seohwan, et autres
Publié: (2026)
par: Yu, Andrew Seohwan, et autres
Publié: (2026)
VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation
par: Huang, Peng, et autres
Publié: (2025)
par: Huang, Peng, et autres
Publié: (2025)
Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment
par: Wijaya, Robert, et autres
Publié: (2024)
par: Wijaya, Robert, et autres
Publié: (2024)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
Co-Evidential Fusion with Information Volume for Medical Image Segmentation
par: He, Yuanpeng, et autres
Publié: (2025)
par: He, Yuanpeng, et autres
Publié: (2025)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
par: Li, Qiaoru, et autres
Publié: (2026)
par: Li, Qiaoru, et autres
Publié: (2026)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
par: Guo, Pinxue, et autres
Publié: (2025)
par: Guo, Pinxue, et autres
Publié: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
par: Liu, Jiyao, et autres
Publié: (2025)
par: Liu, Jiyao, et autres
Publié: (2025)
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
par: Liu, Jiyao, et autres
Publié: (2026)
par: Liu, Jiyao, et autres
Publié: (2026)
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
par: Shi, Baorong, et autres
Publié: (2026)
par: Shi, Baorong, et autres
Publié: (2026)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
par: Zafar, Anas, et autres
Publié: (2026)
par: Zafar, Anas, et autres
Publié: (2026)
Mutual Evidential Deep Learning for Medical Image Segmentation
par: He, Yuanpeng, et autres
Publié: (2025)
par: He, Yuanpeng, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
par: He, Jinlong, et autres
Publié: (2024)
par: He, Jinlong, et autres
Publié: (2024)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
par: Jiang, Juntao, et autres
Publié: (2026)
par: Jiang, Juntao, et autres
Publié: (2026)
Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images
par: Wolf, Daniel, et autres
Publié: (2025)
par: Wolf, Daniel, et autres
Publié: (2025)
MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation
par: Rezvani, Arghavan, et autres
Publié: (2025)
par: Rezvani, Arghavan, et autres
Publié: (2025)
How Well Do Supervised 3D Models Transfer to Medical Imaging Tasks?
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
par: Li, Rang, et autres
Publié: (2025)
par: Li, Rang, et autres
Publié: (2025)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
par: Bao, Zhijie, et autres
Publié: (2026)
par: Bao, Zhijie, et autres
Publié: (2026)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
par: Gao, Yifan, et autres
Publié: (2026)
par: Gao, Yifan, et autres
Publié: (2026)
Unified and Semantically Grounded Domain Adaptation for Medical Image Segmentation
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Medical Visual Prompting (MVP): A Unified Framework for Versatile and High-Quality Medical Image Segmentation
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
SMAFormer: Synergistic Multi-Attention Transformer for Medical Image Segmentation
par: Zheng, Fuchen, et autres
Publié: (2024)
par: Zheng, Fuchen, et autres
Publié: (2024)
On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
par: Van, Minh-Hao, et autres
Publié: (2024)
par: Van, Minh-Hao, et autres
Publié: (2024)
Medical Knowledge Intervention Prompt Tuning for Medical Image Classification
par: Du, Ye, et autres
Publié: (2025)
par: Du, Ye, et autres
Publié: (2025)
CountQA: How Well Do MLLMs Count in the Wild?
par: Tamarapalli, Jayant Sravan, et autres
Publié: (2025)
par: Tamarapalli, Jayant Sravan, et autres
Publié: (2025)
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
par: Liu, Jiyao, et autres
Publié: (2026)
par: Liu, Jiyao, et autres
Publié: (2026)
Documents similaires
-
Brain‐FM: A Multimodal Foundation Model for Visual Question Answering in Brain Health Diagnostics
par: Somayeh Ebrahimkhani, et autres
Publié: (2025) -
AIR: Zero-shot Generative Model Adaptation with Iterative Refinement
par: Liu, Guimeng, et autres
Publié: (2025) -
Vision Transformer Neural Architecture Search for Out-of-Distribution Generalization: Benchmark and Insights
par: Ho, Sy-Tuyen, et autres
Publié: (2025) -
A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot
par: Abdollahzadeh, Milad, et autres
Publié: (2023) -
Text to Image Generation and Editing: A Survey
par: Yang, Pengfei, et autres
Publié: (2025)