Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Qiuhui, Yao, Xuancheng, Ye, Huping, Hong, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024)
AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024)
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
von: Shi, Yiming, et al.
Veröffentlicht: (2024)
von: Shi, Yiming, et al.
Veröffentlicht: (2024)
HoloDx: Knowledge- and Data-Driven Multimodal Diagnosis of Alzheimer's Disease
von: Chen, Qiuhui, et al.
Veröffentlicht: (2025)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2025)
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions
von: Xue, Jintang, et al.
Veröffentlicht: (2025)
von: Xue, Jintang, et al.
Veröffentlicht: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
von: Li, Chen, et al.
Veröffentlicht: (2025)
von: Li, Chen, et al.
Veröffentlicht: (2025)
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
von: Deria, Ankan, et al.
Veröffentlicht: (2026)
von: Deria, Ankan, et al.
Veröffentlicht: (2026)
Volumetric Conditioning Module to Control Pretrained Diffusion Models for 3D Medical Images
von: Ahn, Suhyun, et al.
Veröffentlicht: (2024)
von: Ahn, Suhyun, et al.
Veröffentlicht: (2024)
Time-to-Event Pretraining for 3D Medical Imaging
von: Huo, Zepeng, et al.
Veröffentlicht: (2024)
von: Huo, Zepeng, et al.
Veröffentlicht: (2024)
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
3D Vision and Language Pretraining with Large-Scale Synthetic Data
von: Yang, Dejie, et al.
Veröffentlicht: (2024)
von: Yang, Dejie, et al.
Veröffentlicht: (2024)
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
von: Bai, Fan, et al.
Veröffentlicht: (2024)
von: Bai, Fan, et al.
Veröffentlicht: (2024)
Contrastive Language-Colored Pointmap Pretraining for Unified 3D Scene Understanding
von: Mao, Ye, et al.
Veröffentlicht: (2026)
von: Mao, Ye, et al.
Veröffentlicht: (2026)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
von: Wang, Chunshi, et al.
Veröffentlicht: (2025)
MedUniSeg: 2D and 3D Medical Image Segmentation via a Prompt-driven Universal Model
von: Ye, Yiwen, et al.
Veröffentlicht: (2024)
von: Ye, Yiwen, et al.
Veröffentlicht: (2024)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation
von: Li, Haoqing, et al.
Veröffentlicht: (2025)
von: Li, Haoqing, et al.
Veröffentlicht: (2025)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
von: Jia, Yueru, et al.
Veröffentlicht: (2024)
von: Jia, Yueru, et al.
Veröffentlicht: (2024)
Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models
von: Thomas, Hugues, et al.
Veröffentlicht: (2025)
von: Thomas, Hugues, et al.
Veröffentlicht: (2025)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
von: Yang, Qu, et al.
Veröffentlicht: (2024)
von: Yang, Qu, et al.
Veröffentlicht: (2024)
Semi-Supervised 3D Medical Segmentation from 2D Natural Images Pretrained Model
von: Yeung, Pak-Hei, et al.
Veröffentlicht: (2025)
von: Yeung, Pak-Hei, et al.
Veröffentlicht: (2025)
Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding
von: Qian, Guocheng, et al.
Veröffentlicht: (2022)
von: Qian, Guocheng, et al.
Veröffentlicht: (2022)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
von: Li, Haoyuan, et al.
Veröffentlicht: (2025)
von: Li, Haoyuan, et al.
Veröffentlicht: (2025)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
Can Multimodal Large Language Models Truly Understand Small Objects?
von: Han, Fujun, et al.
Veröffentlicht: (2026)
von: Han, Fujun, et al.
Veröffentlicht: (2026)
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
von: Hamamci, Ibrahim Ethem, et al.
Veröffentlicht: (2025)
von: Hamamci, Ibrahim Ethem, et al.
Veröffentlicht: (2025)
CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model Generation
von: Li, Jiahao, et al.
Veröffentlicht: (2025)
von: Li, Jiahao, et al.
Veröffentlicht: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
von: Fu, Pei, et al.
Veröffentlicht: (2025)
von: Fu, Pei, et al.
Veröffentlicht: (2025)
ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026)
Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
von: Wang, Zixuan, et al.
Veröffentlicht: (2025)
von: Wang, Zixuan, et al.
Veröffentlicht: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
von: Yang, Yu-Qi, et al.
Veröffentlicht: (2024)
von: Yang, Yu-Qi, et al.
Veröffentlicht: (2024)
OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding
von: Liu, Zixian, et al.
Veröffentlicht: (2026)
von: Liu, Zixian, et al.
Veröffentlicht: (2026)
Unsupervised Multimodal 3D Medical Image Registration with Multilevel Correlation Balanced Optimization
von: Wang, Jiazheng, et al.
Veröffentlicht: (2024)
von: Wang, Jiazheng, et al.
Veröffentlicht: (2024)
Aligning Medical Images with General Knowledge from Large Language Models
von: Fang, Xiao, et al.
Veröffentlicht: (2024)
von: Fang, Xiao, et al.
Veröffentlicht: (2024)
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
von: Liu, Han, et al.
Veröffentlicht: (2025)
von: Liu, Han, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024) -
AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026) -
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
von: Chen, Qiuhui, et al.
Veröffentlicht: (2024) -
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
von: Chen, Qiuhui, et al.
Veröffentlicht: (2026) -
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
von: Shi, Yiming, et al.
Veröffentlicht: (2024)