Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Qiuhui, Yao, Xuancheng, Ye, Huping, Hong, Yi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2024)
by: Chen, Qiuhui, et al.
Published: (2024)
AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis
by: Chen, Qiuhui, et al.
Published: (2026)
by: Chen, Qiuhui, et al.
Published: (2026)
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
by: Chen, Qiuhui, et al.
Published: (2024)
by: Chen, Qiuhui, et al.
Published: (2024)
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2026)
by: Chen, Qiuhui, et al.
Published: (2026)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)
by: Shi, Yiming, et al.
Published: (2024)
HoloDx: Knowledge- and Data-Driven Multimodal Diagnosis of Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2025)
by: Chen, Qiuhui, et al.
Published: (2025)
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions
by: Xue, Jintang, et al.
Published: (2025)
by: Xue, Jintang, et al.
Published: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
by: Deria, Ankan, et al.
Published: (2026)
by: Deria, Ankan, et al.
Published: (2026)
Volumetric Conditioning Module to Control Pretrained Diffusion Models for 3D Medical Images
by: Ahn, Suhyun, et al.
Published: (2024)
by: Ahn, Suhyun, et al.
Published: (2024)
Time-to-Event Pretraining for 3D Medical Imaging
by: Huo, Zepeng, et al.
Published: (2024)
by: Huo, Zepeng, et al.
Published: (2024)
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
by: Liu, Ruiping, et al.
Published: (2025)
by: Liu, Ruiping, et al.
Published: (2025)
3D Vision and Language Pretraining with Large-Scale Synthetic Data
by: Yang, Dejie, et al.
Published: (2024)
by: Yang, Dejie, et al.
Published: (2024)
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
by: Bai, Fan, et al.
Published: (2024)
by: Bai, Fan, et al.
Published: (2024)
Contrastive Language-Colored Pointmap Pretraining for Unified 3D Scene Understanding
by: Mao, Ye, et al.
Published: (2026)
by: Mao, Ye, et al.
Published: (2026)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
by: Xiong, Haomiao, et al.
Published: (2025)
by: Xiong, Haomiao, et al.
Published: (2025)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
by: Wang, Chunshi, et al.
Published: (2025)
by: Wang, Chunshi, et al.
Published: (2025)
MedUniSeg: 2D and 3D Medical Image Segmentation via a Prompt-driven Universal Model
by: Ye, Yiwen, et al.
Published: (2024)
by: Ye, Yiwen, et al.
Published: (2024)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
by: Huang, Jiaxin, et al.
Published: (2025)
by: Huang, Jiaxin, et al.
Published: (2025)
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation
by: Li, Haoqing, et al.
Published: (2025)
by: Li, Haoqing, et al.
Published: (2025)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
by: Jia, Yueru, et al.
Published: (2024)
by: Jia, Yueru, et al.
Published: (2024)
Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models
by: Thomas, Hugues, et al.
Published: (2025)
by: Thomas, Hugues, et al.
Published: (2025)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
by: Yang, Qu, et al.
Published: (2024)
by: Yang, Qu, et al.
Published: (2024)
Semi-Supervised 3D Medical Segmentation from 2D Natural Images Pretrained Model
by: Yeung, Pak-Hei, et al.
Published: (2025)
by: Yeung, Pak-Hei, et al.
Published: (2025)
Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding
by: Qian, Guocheng, et al.
Published: (2022)
by: Qian, Guocheng, et al.
Published: (2022)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
by: Liu, Shengyuan, et al.
Published: (2026)
by: Liu, Shengyuan, et al.
Published: (2026)
UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
by: Wang, Lehan, et al.
Published: (2025)
by: Wang, Lehan, et al.
Published: (2025)
Can Multimodal Large Language Models Truly Understand Small Objects?
by: Han, Fujun, et al.
Published: (2026)
by: Han, Fujun, et al.
Published: (2026)
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model Generation
by: Li, Jiahao, et al.
Published: (2025)
by: Li, Jiahao, et al.
Published: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
by: Fu, Pei, et al.
Published: (2025)
by: Fu, Pei, et al.
Published: (2025)
ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection
by: Chen, Qiuhui, et al.
Published: (2026)
by: Chen, Qiuhui, et al.
Published: (2026)
Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
by: Wang, Zixuan, et al.
Published: (2025)
by: Wang, Zixuan, et al.
Published: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
by: Yang, Yu-Qi, et al.
Published: (2024)
by: Yang, Yu-Qi, et al.
Published: (2024)
OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding
by: Liu, Zixian, et al.
Published: (2026)
by: Liu, Zixian, et al.
Published: (2026)
Unsupervised Multimodal 3D Medical Image Registration with Multilevel Correlation Balanced Optimization
by: Wang, Jiazheng, et al.
Published: (2024)
by: Wang, Jiazheng, et al.
Published: (2024)
Aligning Medical Images with General Knowledge from Large Language Models
by: Fang, Xiao, et al.
Published: (2024)
by: Fang, Xiao, et al.
Published: (2024)
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
by: Liu, Han, et al.
Published: (2025)
by: Liu, Han, et al.
Published: (2025)
Similar Items
-
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2024) -
AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis
by: Chen, Qiuhui, et al.
Published: (2026) -
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
by: Chen, Qiuhui, et al.
Published: (2024) -
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2026) -
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)