Location-Aware Pretraining for Medical Difference Visual Question Answering

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Musinguzi, Denis, Han, Caren, Mitra, Prasenjit
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866918461646569472
author Musinguzi, Denis
Han, Caren
Mitra, Prasenjit
author_facet Musinguzi, Denis
Han, Caren
Mitra, Prasenjit
contents Differential medical VQA models compare multiple images to identify clinically meaningful changes and rely on vision encoders to capture fine-grained visual differences that reflect radiologists' comparative diagnostic workflows. However, vision encoders trained using standard contrastive or classification objectives often fail to capture the subtle variations needed to distinguish true disease progression from acquisition-related variability. To address this limitation, we introduce a location-aware pretraining framework that incorporates automatic referring expressions (AREF), grounded captioning (GCAP), and conditional automatic referring expressions (CAREF). These tasks promote the learning of fine-grained, spatially grounded visual representations. When integrated with a language model, our approach achieves state-of-the-art performance on medical difference VQA by accurately identifying and reasoning about clinically relevant changes in chest X-ray images.
format Preprint
id arxiv_https___arxiv_org_abs_2603_04950
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Location-Aware Pretraining for Medical Difference Visual Question Answering
Musinguzi, Denis
Han, Caren
Mitra, Prasenjit
Computer Vision and Pattern Recognition
Artificial Intelligence
Differential medical VQA models compare multiple images to identify clinically meaningful changes and rely on vision encoders to capture fine-grained visual differences that reflect radiologists' comparative diagnostic workflows. However, vision encoders trained using standard contrastive or classification objectives often fail to capture the subtle variations needed to distinguish true disease progression from acquisition-related variability. To address this limitation, we introduce a location-aware pretraining framework that incorporates automatic referring expressions (AREF), grounded captioning (GCAP), and conditional automatic referring expressions (CAREF). These tasks promote the learning of fine-grained, spatially grounded visual representations. When integrated with a language model, our approach achieves state-of-the-art performance on medical difference VQA by accurately identifying and reasoning about clinically relevant changes in chest X-ray images.
title Location-Aware Pretraining for Medical Difference Visual Question Answering
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2603.04950