Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Yang, Xu, Dunyuan, Li, Yaoqian, Li, Xiaomeng, Li, Jinpeng, Heng, Pheng-Ann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2026)
di: Xu, Dunyuan, et al.
Pubblicazione: (2026)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Towards Synchronous Memorizability and Generalizability with Site-Modulated Diffusion Replay for Cross-Site Continual Segmentation
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
Depth-Driven Geometric Prompt Learning for Laparoscopic Liver Landmark Detection
di: Pei, Jialun, et al.
Pubblicazione: (2024)
di: Pei, Jialun, et al.
Pubblicazione: (2024)
3DSAM-adapter: Holistic adaptation of SAM from 2D to 3D for promptable tumor segmentation
di: Gong, Shizhan, et al.
Pubblicazione: (2023)
di: Gong, Shizhan, et al.
Pubblicazione: (2023)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
SiMA-Hand: Boosting 3D Hand-Mesh Reconstruction by Single-to-Multi-View Adaptation
di: Wang, Yinqiao, et al.
Pubblicazione: (2024)
di: Wang, Yinqiao, et al.
Pubblicazione: (2024)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
di: Wang, Jiaze, et al.
Pubblicazione: (2024)
di: Wang, Jiaze, et al.
Pubblicazione: (2024)
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
di: Bai, Fan, et al.
Pubblicazione: (2024)
di: Bai, Fan, et al.
Pubblicazione: (2024)
Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework
di: Zhu, Yu, et al.
Pubblicazione: (2026)
di: Zhu, Yu, et al.
Pubblicazione: (2026)
Decoupling Feature Representations of Ego and Other Modalities for Incomplete Multi-modal Brain Tumor Segmentation
di: Yang, Kaixiang, et al.
Pubblicazione: (2024)
di: Yang, Kaixiang, et al.
Pubblicazione: (2024)
Adapt PointFormer: 3D Point Cloud Analysis via Adapting 2D Visual Transformers
di: Li, Mengke, et al.
Pubblicazione: (2024)
di: Li, Mengke, et al.
Pubblicazione: (2024)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
Adapting Segment Anything Model for Unseen Object Instance Segmentation
di: Cao, Rui, et al.
Pubblicazione: (2024)
di: Cao, Rui, et al.
Pubblicazione: (2024)
Unifying Physically-Informed Weather Priors in A Single Model for Image Restoration Across Multiple Adverse Weather Conditions
di: Xu, Jiaqi, et al.
Pubblicazione: (2026)
di: Xu, Jiaqi, et al.
Pubblicazione: (2026)
SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model
di: Li, Yaoqian, et al.
Pubblicazione: (2025)
di: Li, Yaoqian, et al.
Pubblicazione: (2025)
Cross Prompting Consistency with Segment Anything Model for Semi-supervised Medical Image Segmentation
di: Miao, Juzheng, et al.
Pubblicazione: (2024)
di: Miao, Juzheng, et al.
Pubblicazione: (2024)
SCJD: Sparse Correlation and Joint Distillation for Efficient 3D Human Pose Estimation
di: Chen, Weihong, et al.
Pubblicazione: (2025)
di: Chen, Weihong, et al.
Pubblicazione: (2025)
Memory-Efficient Prompt Tuning for Incremental Histopathology Classification
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
di: Chen, Qiuhui, et al.
Pubblicazione: (2024)
di: Chen, Qiuhui, et al.
Pubblicazione: (2024)
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
MedLSAM: Localize and Segment Anything Model for 3D CT Images
di: Lei, Wenhui, et al.
Pubblicazione: (2023)
di: Lei, Wenhui, et al.
Pubblicazione: (2023)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
di: Yan, Qiao, et al.
Pubblicazione: (2025)
di: Yan, Qiao, et al.
Pubblicazione: (2025)
Tri-Plane Mamba: Efficiently Adapting Segment Anything Model for 3D Medical Images
di: Wang, Hualiang, et al.
Pubblicazione: (2024)
di: Wang, Hualiang, et al.
Pubblicazione: (2024)
Advancing Extended Reality with 3D Gaussian Splatting: Innovations and Prospects
di: Qiu, Shi, et al.
Pubblicazione: (2024)
di: Qiu, Shi, et al.
Pubblicazione: (2024)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
Does Engram Do Memory Retrieval in Autoregressive Image Generation?
di: Wang, Jinghao, et al.
Pubblicazione: (2026)
di: Wang, Jinghao, et al.
Pubblicazione: (2026)
Creating Virtual Environments with 3D Gaussian Splatting: A Comparative Study
di: Qiu, Shi, et al.
Pubblicazione: (2025)
di: Qiu, Shi, et al.
Pubblicazione: (2025)
Improving Adversarial Robustness for 3D Point Cloud Recognition at Test-Time through Purified Self-Training
di: Lin, Jinpeng, et al.
Pubblicazione: (2024)
di: Lin, Jinpeng, et al.
Pubblicazione: (2024)
COS3D: Collaborative Open-Vocabulary 3D Segmentation
di: Zhu, Runsong, et al.
Pubblicazione: (2025)
di: Zhu, Runsong, et al.
Pubblicazione: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
Multi-scale Spatio-temporal Transformer-based Imbalanced Longitudinal Learning for Glaucoma Forecasting from Irregular Time Series Images
di: Yang, Xikai, et al.
Pubblicazione: (2024)
di: Yang, Xikai, et al.
Pubblicazione: (2024)
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
di: Guo, Diandian, et al.
Pubblicazione: (2026)
di: Guo, Diandian, et al.
Pubblicazione: (2026)
M^3Detection: Multi-Frame Multi-Level Feature Fusion for Multi-Modal 3D Object Detection with Camera and 4D Imaging Radar
di: Li, Xiaozhi, et al.
Pubblicazione: (2025)
di: Li, Xiaozhi, et al.
Pubblicazione: (2025)
Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting
di: Zhu, Runsong, et al.
Pubblicazione: (2025)
di: Zhu, Runsong, et al.
Pubblicazione: (2025)
OA-DET3D: Embedding Object Awareness as a General Plug-in for Multi-Camera 3D Object Detection
di: Chu, Xiaomeng, et al.
Pubblicazione: (2023)
di: Chu, Xiaomeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
di: XU, Dunyuan, et al.
Pubblicazione: (2025) -
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2025) -
Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2026) -
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024) -
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)