How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Che, Pan, Jiazhen, Shen, Weixiang, Bai, Wenjia, Rueckert, Daniel, Arcucci, Rossella |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
How Does Diverse Interpretability of Textual Prompts Impact Medical Vision-Language Zero-Shot Tasks?
di: Wang, Sicheng, et al.
Pubblicazione: (2024)
di: Wang, Sicheng, et al.
Pubblicazione: (2024)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks
di: Wu, Peiran, et al.
Pubblicazione: (2024)
di: Wu, Peiran, et al.
Pubblicazione: (2024)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
di: Pan, Jiazhen, et al.
Pubblicazione: (2026)
di: Pan, Jiazhen, et al.
Pubblicazione: (2026)
Does DINOv3 Set a New Medical Vision Standard? Benchmarking 2D and 3D Classification, Segmentation, and Registration
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generation
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training
di: Qin, Jiuming, et al.
Pubblicazione: (2024)
di: Qin, Jiuming, et al.
Pubblicazione: (2024)
Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
di: Shen, Weixiang, et al.
Pubblicazione: (2026)
di: Shen, Weixiang, et al.
Pubblicazione: (2026)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
di: Moll, Johannes, et al.
Pubblicazione: (2025)
di: Moll, Johannes, et al.
Pubblicazione: (2025)
Towards Cardiac MRI Foundation Models: Comprehensive Visual-Tabular Representations for Whole-Heart Assessment and Beyond
di: Zhang, Yundi, et al.
Pubblicazione: (2025)
di: Zhang, Yundi, et al.
Pubblicazione: (2025)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval
di: Chen, Yinda, et al.
Pubblicazione: (2024)
di: Chen, Yinda, et al.
Pubblicazione: (2024)
Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2026)
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2026)
Reconstruct or Generate: Exploring the Spectrum of Generative Modeling for Cardiac MRI
di: Bubeck, Niklas, et al.
Pubblicazione: (2025)
di: Bubeck, Niklas, et al.
Pubblicazione: (2025)
Noise2Noise Denoising of CRISM Hyperspectral Data
di: Platt, Robert, et al.
Pubblicazione: (2024)
di: Platt, Robert, et al.
Pubblicazione: (2024)
BOTM: Echocardiography Segmentation via Bi-directional Optimal Token Matching
di: Liu, Zhihua, et al.
Pubblicazione: (2025)
di: Liu, Zhihua, et al.
Pubblicazione: (2025)
How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
No Image, No Problem: End-to-End Multi-Task Cardiac Analysis from Undersampled k-Space
di: Zhang, Yundi, et al.
Pubblicazione: (2026)
di: Zhang, Yundi, et al.
Pubblicazione: (2026)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
di: Yu, Hong-Tao, et al.
Pubblicazione: (2025)
di: Yu, Hong-Tao, et al.
Pubblicazione: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
Beyond Distillation: Pushing the Limits of Medical LLM Reasoning with Minimalist Rule-Based RL
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2025)
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2025)
Disentangling Progress in Medical Image Registration: Beyond Trend-Driven Architectures towards Domain-Specific Strategies
di: Jian, Bailiang, et al.
Pubblicazione: (2025)
di: Jian, Bailiang, et al.
Pubblicazione: (2025)
Motion-compensated MR CINE reconstruction with reconstruction-driven motion estimation
di: Pan, Jiazhen, et al.
Pubblicazione: (2023)
di: Pan, Jiazhen, et al.
Pubblicazione: (2023)
Classification, Regression and Segmentation directly from k-Space in Cardiac MRI
di: Li, Ruochen, et al.
Pubblicazione: (2024)
di: Li, Ruochen, et al.
Pubblicazione: (2024)
Evidential learning driven Breast Tumor Segmentation with Stage-divided Vision-Language Interaction
di: Zhong, Jingxing, et al.
Pubblicazione: (2026)
di: Zhong, Jingxing, et al.
Pubblicazione: (2026)
Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision-Language Models
di: Suzuki, Teppei, et al.
Pubblicazione: (2025)
di: Suzuki, Teppei, et al.
Pubblicazione: (2025)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
di: Lu, Fan, et al.
Pubblicazione: (2024)
di: Lu, Fan, et al.
Pubblicazione: (2024)
Mamba? Catch The Hype Or Rethink What Really Helps for Image Registration
di: Jian, Bailiang, et al.
Pubblicazione: (2024)
di: Jian, Bailiang, et al.
Pubblicazione: (2024)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
di: Yang, Luyu, et al.
Pubblicazione: (2026)
di: Yang, Luyu, et al.
Pubblicazione: (2026)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
di: Liu, Che, et al.
Pubblicazione: (2023) -
How Does Diverse Interpretability of Textual Prompts Impact Medical Vision-Language Zero-Shot Tasks?
di: Wang, Sicheng, et al.
Pubblicazione: (2024) -
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
di: Liu, Che, et al.
Pubblicazione: (2023) -
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
di: Li, Jun, et al.
Pubblicazione: (2025) -
G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training
di: Liu, Che, et al.
Pubblicazione: (2023)