Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights
Fuente:
arXiv
Saved in:
| Main Authors: | Zhong, Yuan, Jin, Ruinan, Dou, Qi, Li, Xiaoxiao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Interactive Tumor Progression Modeling via Sketch-Based Image Editing
by: Huang, Gexin, et al.
Published: (2025)
by: Huang, Gexin, et al.
Published: (2025)
VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
by: Qiu, Jianing, et al.
Published: (2023)
by: Qiu, Jianing, et al.
Published: (2023)
Bora: Biomedical Generalist Video Generation Model
by: Sun, Weixiang, et al.
Published: (2024)
by: Sun, Weixiang, et al.
Published: (2024)
Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics
by: Zhou, Yukun, et al.
Published: (2025)
by: Zhou, Yukun, et al.
Published: (2025)
Adapting Medical Vision Foundation Models for Volumetric Medical Image Segmentation via Active Learning and Selective Semi-supervised Fine-tuning
by: Yang, Jin, et al.
Published: (2025)
by: Yang, Jin, et al.
Published: (2025)
Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review
by: Lin, Haoneng, et al.
Published: (2025)
by: Lin, Haoneng, et al.
Published: (2025)
Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks
by: Müller-Franzes, Gustav, et al.
Published: (2025)
by: Müller-Franzes, Gustav, et al.
Published: (2025)
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
by: Xin, Yu, et al.
Published: (2025)
by: Xin, Yu, et al.
Published: (2025)
VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation
by: Dietlmeier, Julia, et al.
Published: (2025)
by: Dietlmeier, Julia, et al.
Published: (2025)
SemiSAM+: Rethinking Semi-Supervised Medical Image Segmentation in the Era of Foundation Models
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Vision-Language Controlled Deep Unfolding for Joint Medical Image Restoration and Segmentation
by: Chen, Ping, et al.
Published: (2026)
by: Chen, Ping, et al.
Published: (2026)
Vision Foundation Models in Medical Image Analysis: Advances and Challenges
by: Liang, Pengchen, et al.
Published: (2025)
by: Liang, Pengchen, et al.
Published: (2025)
Downstream Analysis of Foundational Medical Vision Models for Disease Progression
by: Demir, Basar, et al.
Published: (2025)
by: Demir, Basar, et al.
Published: (2025)
Specialty-Oriented Generalist Medical AI for Chest CT Screening
by: Niu, Chuang, et al.
Published: (2023)
by: Niu, Chuang, et al.
Published: (2023)
NCF: Neural Correspondence Field for Medical Image Registration
by: Zhou, Lei, et al.
Published: (2025)
by: Zhou, Lei, et al.
Published: (2025)
MedImageInsight: An Open-Source Embedding Model for General Domain Medical Imaging
by: Codella, Noel C. F., et al.
Published: (2024)
by: Codella, Noel C. F., et al.
Published: (2024)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
by: Gavrikov, Paul, et al.
Published: (2025)
by: Gavrikov, Paul, et al.
Published: (2025)
BMAD: Benchmarks for Medical Anomaly Detection
by: Bao, Jinan, et al.
Published: (2023)
by: Bao, Jinan, et al.
Published: (2023)
Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images
by: TehraniNasab, Zahra, et al.
Published: (2025)
by: TehraniNasab, Zahra, et al.
Published: (2025)
PET2Rep: Towards Vision-Language Model-Drived Automated Radiology Report Generation for Positron Emission Tomography
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Generalist Segmentation Algorithm for Photoreceptors Analysis in Adaptive Optics Imaging
by: Kulyabin, Mikhail, et al.
Published: (2024)
by: Kulyabin, Mikhail, et al.
Published: (2024)
Quantitative Metrics for Benchmarking Medical Image Harmonization
by: Parida, Abhijeet, et al.
Published: (2024)
by: Parida, Abhijeet, et al.
Published: (2024)
MAMBO-NET: Multi-Causal Aware Modeling Backdoor-Intervention Optimization for Medical Image Segmentation Network
by: Yu, Ruiguo, et al.
Published: (2025)
by: Yu, Ruiguo, et al.
Published: (2025)
Vision-Language Model Based Multi-Expert Fusion for CT Image Classification
by: Bai, Jianfa, et al.
Published: (2026)
by: Bai, Jianfa, et al.
Published: (2026)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
by: Jiang, Juntao, et al.
Published: (2026)
by: Jiang, Juntao, et al.
Published: (2026)
INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
by: Tankel, Idan, et al.
Published: (2025)
by: Tankel, Idan, et al.
Published: (2025)
Generative Enhancement for 3D Medical Images
by: Zhu, Lingting, et al.
Published: (2024)
by: Zhu, Lingting, et al.
Published: (2024)
Can Large Language Models Challenge CNNs in Medical Image Analysis?
by: Ahmed, Shibbir, et al.
Published: (2025)
by: Ahmed, Shibbir, et al.
Published: (2025)
Can Foundation Models Really Segment Tumors? A Benchmarking Odyssey in Lung CT Imaging
by: Ayllón, Elena Mulero, et al.
Published: (2025)
by: Ayllón, Elena Mulero, et al.
Published: (2025)
MONICA: Benchmarking on Long-tailed Medical Image Classification
by: Ju, Lie, et al.
Published: (2024)
by: Ju, Lie, et al.
Published: (2024)
Segment Anything in Medical Images and Videos: Benchmark and Deployment
by: Ma, Jun, et al.
Published: (2024)
by: Ma, Jun, et al.
Published: (2024)
Large-Scale Label Quality Assessment for Medical Segmentation via a Vision-Language Judge and Synthetic Data
by: Chen, Yixiong, et al.
Published: (2026)
by: Chen, Yixiong, et al.
Published: (2026)
Curriculum Fine-tuning of Vision Foundation Model for Medical Image Classification Under Label Noise
by: Yu, Yeonguk, et al.
Published: (2024)
by: Yu, Yeonguk, et al.
Published: (2024)
Vision Models for Medical Imaging: A Hybrid Approach for PCOS Detection from Ultrasound Scans
by: Hoque, Md Mahmudul, et al.
Published: (2026)
by: Hoque, Md Mahmudul, et al.
Published: (2026)
GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
by: Chen, Pengcheng, et al.
Published: (2024)
by: Chen, Pengcheng, et al.
Published: (2024)
Multiscale Latent Diffusion Model for Enhanced Feature Extraction from Medical Images
by: Sadia, Rabeya Tus, et al.
Published: (2024)
by: Sadia, Rabeya Tus, et al.
Published: (2024)
VM-DDPM: Vision Mamba Diffusion for Medical Image Synthesis
by: Ju, Zhihan, et al.
Published: (2024)
by: Ju, Zhihan, et al.
Published: (2024)
VM-UNet: Vision Mamba UNet for Medical Image Segmentation
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Universal and Extensible Language-Vision Models for Organ Segmentation and Tumor Detection from Abdominal Computed Tomography
by: Liu, Jie, et al.
Published: (2024)
by: Liu, Jie, et al.
Published: (2024)
Joint Lossless Compression and Steganography for Medical Images via Large Language Models
by: Zheng, Pengcheng, et al.
Published: (2025)
by: Zheng, Pengcheng, et al.
Published: (2025)
Similar Items
-
Interactive Tumor Progression Modeling via Sketch-Based Image Editing
by: Huang, Gexin, et al.
Published: (2025) -
VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
by: Qiu, Jianing, et al.
Published: (2023) -
Bora: Biomedical Generalist Video Generation Model
by: Sun, Weixiang, et al.
Published: (2024) -
Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics
by: Zhou, Yukun, et al.
Published: (2025) -
Adapting Medical Vision Foundation Models for Volumetric Medical Image Segmentation via Active Learning and Selective Semi-supervised Fine-tuning
by: Yang, Jin, et al.
Published: (2025)