ProbMed: A Probabilistic Framework for Medical Multimodal Binding

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Gao, Yuan, Kim, Sangwook, You, Jianzhong, McIntosh, Chris
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866918151438991360
author Gao, Yuan
Kim, Sangwook
You, Jianzhong
McIntosh, Chris
author_facet Gao, Yuan
Kim, Sangwook
You, Jianzhong
McIntosh, Chris
contents Medical decision-making requires integrating diverse medical information, from imaging to clinical narratives. These medical modalities are often acquired in a many-to-many manner. However, current medical vision-language pretraining models (Med-VLPMs) fail to directly account for this many-to-many mapping in their model training and embeddings. To address this, we present Probabilistic Modality-Enhanced Diagnosis (ProbMED), a multimodal Med-VLPM that employs probabilistic contrastive learning to model distributions over embeddings rather than deterministic estimates. ProbMED aligns four distinct modalities -- chest X-rays, electrocardiograms, echocardiograms, and clinical text -- into a unified probabilistic embedding space. We use InfoNCE loss with Hellinger distance to integrate inter-modality distributions. We introduce a probabilistic synthetic sampling loss that captures modality-specific mean and variance to improve intra-modality binding. Extensive experiments across 13 medical datasets demonstrate that our model outperforms current Med-VLPMs in cross-modality retrieval, zero-shot, and few-shot classification. We also demonstrate the robust integration of multiple modalities for prognostication, showing improved intra- and inter-medical modality binding.
format Preprint
id arxiv_https___arxiv_org_abs_2509_25711
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ProbMed: A Probabilistic Framework for Medical Multimodal Binding
Gao, Yuan
Kim, Sangwook
You, Jianzhong
McIntosh, Chris
Computer Vision and Pattern Recognition
Medical decision-making requires integrating diverse medical information, from imaging to clinical narratives. These medical modalities are often acquired in a many-to-many manner. However, current medical vision-language pretraining models (Med-VLPMs) fail to directly account for this many-to-many mapping in their model training and embeddings. To address this, we present Probabilistic Modality-Enhanced Diagnosis (ProbMED), a multimodal Med-VLPM that employs probabilistic contrastive learning to model distributions over embeddings rather than deterministic estimates. ProbMED aligns four distinct modalities -- chest X-rays, electrocardiograms, echocardiograms, and clinical text -- into a unified probabilistic embedding space. We use InfoNCE loss with Hellinger distance to integrate inter-modality distributions. We introduce a probabilistic synthetic sampling loss that captures modality-specific mean and variance to improve intra-modality binding. Extensive experiments across 13 medical datasets demonstrate that our model outperforms current Med-VLPMs in cross-modality retrieval, zero-shot, and few-shot classification. We also demonstrate the robust integration of multiple modalities for prognostication, showing improved intra- and inter-medical modality binding.
title ProbMed: A Probabilistic Framework for Medical Multimodal Binding
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2509.25711