Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Trinh, Quoc-Huy, Ding, Xi, Liu, Yang, Qin, Zhenyue, Li, Xingjian, Durak, Gorkem, Aktas, Halil Ertugrul, Keles, Elif, Bagci, Ulas, Xu, Min
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:https://arxiv.org/abs/2603.13800
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866912966064996352
author Trinh, Quoc-Huy
Ding, Xi
Liu, Yang
Qin, Zhenyue
Li, Xingjian
Durak, Gorkem
Aktas, Halil Ertugrul
Keles, Elif
Bagci, Ulas
Xu, Min
author_facet Trinh, Quoc-Huy
Ding, Xi
Liu, Yang
Qin, Zhenyue
Li, Xingjian
Durak, Gorkem
Aktas, Halil Ertugrul
Keles, Elif
Bagci, Ulas
Xu, Min
contents Visual spatial intelligence is critical for medical image interpretation, yet remains largely unexplored in Multimodal Large Language Models (MLLMs) for 3D imaging. This gap persists due to a systemic lack of datasets featuring structured 3D spatial annotations beyond basic labels. In this study, we introduce an agentic pipeline that autonomously synthesizes spatial visual question-answering (VQA) data by orchestrating computational tools such as volume and distance calculators with multi-agent collaboration and expert radiologist validation. We present SpatialMed, the first comprehensive benchmark for evaluating 3D spatial intelligence in medical MLLMs, comprising nearly 10K question-answer pairs across multiple organs and tumor types. Our evaluations on 14 state-of-the-art MLLMs and extensive analyses reveal that current models lack robust spatial reasoning capabilities for medical imaging.
format Preprint
id arxiv_https___arxiv_org_abs_2603_13800
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space
Trinh, Quoc-Huy
Ding, Xi
Liu, Yang
Qin, Zhenyue
Li, Xingjian
Durak, Gorkem
Aktas, Halil Ertugrul
Keles, Elif
Bagci, Ulas
Xu, Min
Computer Vision and Pattern Recognition
Visual spatial intelligence is critical for medical image interpretation, yet remains largely unexplored in Multimodal Large Language Models (MLLMs) for 3D imaging. This gap persists due to a systemic lack of datasets featuring structured 3D spatial annotations beyond basic labels. In this study, we introduce an agentic pipeline that autonomously synthesizes spatial visual question-answering (VQA) data by orchestrating computational tools such as volume and distance calculators with multi-agent collaboration and expert radiologist validation. We present SpatialMed, the first comprehensive benchmark for evaluating 3D spatial intelligence in medical MLLMs, comprising nearly 10K question-answer pairs across multiple organs and tumor types. Our evaluations on 14 state-of-the-art MLLMs and extensive analyses reveal that current models lack robust spatial reasoning capabilities for medical imaging.
title Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2603.13800