Saved in:
| Main Authors: | Bai, Fan, Du, Yuxin, Huang, Tiejun, Meng, Max Q. -H., Zhao, Bo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2404.00578 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SegVol: Universal and Interactive Volumetric Medical Image Segmentation
by: Du, Yuxin, et al.
Published: (2023)
by: Du, Yuxin, et al.
Published: (2023)
Robust and Accurate Multi-view 2D/3D Image Registration with Differentiable X-ray Rendering and Dual Cross-view Constraints
by: Cui, Yuxin, et al.
Published: (2025)
by: Cui, Yuxin, et al.
Published: (2025)
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2024)
by: Chen, Qiuhui, et al.
Published: (2024)
Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
by: Yu, Yang, et al.
Published: (2026)
by: Yu, Yang, et al.
Published: (2026)
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
MTMed3D: A Multi-Task Transformer-Based Model for 3D Medical Imaging
by: Li, Fan, et al.
Published: (2025)
by: Li, Fan, et al.
Published: (2025)
MedGS: Gaussian Splatting for Multi-Modal 3D Medical Imaging
by: Marzol, Kacper, et al.
Published: (2025)
by: Marzol, Kacper, et al.
Published: (2025)
M3: 3D-Spatial MultiModal Memory
by: Zou, Xueyan, et al.
Published: (2025)
by: Zou, Xueyan, et al.
Published: (2025)
Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging
by: Pan, Tan, et al.
Published: (2026)
by: Pan, Tan, et al.
Published: (2026)
T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency
by: Liu, Che, et al.
Published: (2023)
by: Liu, Che, et al.
Published: (2023)
3D Human Interaction Generation: A Survey
by: Fan, Siyuan, et al.
Published: (2025)
by: Fan, Siyuan, et al.
Published: (2025)
PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images
by: Chen, Zifan, et al.
Published: (2024)
by: Chen, Zifan, et al.
Published: (2024)
On-the-fly Large-scale 3D Reconstruction from Multi-Camera Rigs
by: Guo, Yijia, et al.
Published: (2025)
by: Guo, Yijia, et al.
Published: (2025)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
by: Huang, Wencan, et al.
Published: (2025)
by: Huang, Wencan, et al.
Published: (2025)
MMPart: Harnessing Multi-Modal Large Language Models for Part-Aware 3D Generation
by: Bonakdar, Omid, et al.
Published: (2025)
by: Bonakdar, Omid, et al.
Published: (2025)
Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2025)
by: Chen, Qiuhui, et al.
Published: (2025)
Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection
by: Bai, Letian, et al.
Published: (2026)
by: Bai, Letian, et al.
Published: (2026)
Pixal3D: Pixel-Aligned 3D Generation from Images
by: Li, Dong-Yang, et al.
Published: (2026)
by: Li, Dong-Yang, et al.
Published: (2026)
Optimizing 3D Diffusion Models for Medical Imaging via Multi-Scale Reward Learning
by: Tian, Yueying, et al.
Published: (2026)
by: Tian, Yueying, et al.
Published: (2026)
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
by: Xin, Yu, et al.
Published: (2025)
by: Xin, Yu, et al.
Published: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
by: Wang, Yuxin, et al.
Published: (2025)
by: Wang, Yuxin, et al.
Published: (2025)
SpikeGS: Reconstruct 3D scene via fast-moving bio-inspired sensors
by: Guo, Yijia, et al.
Published: (2024)
by: Guo, Yijia, et al.
Published: (2024)
Cross-Modal Conditioned Reconstruction for Language-guided Medical Image Segmentation
by: Huang, Xiaoshuang, et al.
Published: (2024)
by: Huang, Xiaoshuang, et al.
Published: (2024)
StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models
by: Zhou, Mohan, et al.
Published: (2024)
by: Zhou, Mohan, et al.
Published: (2024)
Towards Scalable Language-Image Pre-training for 3D Medical Imaging
by: Zhao, Chenhui, et al.
Published: (2025)
by: Zhao, Chenhui, et al.
Published: (2025)
SSFMamba: Learning Symmetry-driven Spatial-Frequency Modeling for Physically Consistent 3D Medical Image Segmentation
by: Zhang, Bo, et al.
Published: (2025)
by: Zhang, Bo, et al.
Published: (2025)
Large-scale Dataset Pruning with Dynamic Uncertainty
by: He, Muyang, et al.
Published: (2023)
by: He, Muyang, et al.
Published: (2023)
Frequency-domain Multi-modal Fusion for Language-guided Medical Image Segmentation
by: Yu, Bo, et al.
Published: (2025)
by: Yu, Bo, et al.
Published: (2025)
VISTA3D: A Unified Segmentation Foundation Model For 3D Medical Imaging
by: He, Yufan, et al.
Published: (2024)
by: He, Yufan, et al.
Published: (2024)
SAT3D: Image-driven Semantic Attribute Transfer in 3D
by: Zhai, Zhijun, et al.
Published: (2024)
by: Zhai, Zhijun, et al.
Published: (2024)
M^3Detection: Multi-Frame Multi-Level Feature Fusion for Multi-Modal 3D Object Detection with Camera and 4D Imaging Radar
by: Li, Xiaozhi, et al.
Published: (2025)
by: Li, Xiaozhi, et al.
Published: (2025)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
by: Wu, Zehuan, et al.
Published: (2024)
by: Wu, Zehuan, et al.
Published: (2024)
ShapeMamba-EM: Fine-Tuning Foundation Model with Local Shape Descriptors and Mamba Blocks for 3D EM Image Segmentation
by: Shi, Ruohua, et al.
Published: (2024)
by: Shi, Ruohua, et al.
Published: (2024)
SM$^3$: Self-Supervised Multi-task Modeling with Multi-view 2D Images for Articulated Objects
by: Wang, Haowen, et al.
Published: (2024)
by: Wang, Haowen, et al.
Published: (2024)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
by: Zhang, Jusheng, et al.
Published: (2026)
by: Zhang, Jusheng, et al.
Published: (2026)
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
by: Liu, Han, et al.
Published: (2025)
by: Liu, Han, et al.
Published: (2025)
Pushing Auto-regressive Models for 3D Shape Generation at Capacity and Scalability
by: Qian, Xuelin, et al.
Published: (2024)
by: Qian, Xuelin, et al.
Published: (2024)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
by: Huang, Yuzhou, et al.
Published: (2024)
by: Huang, Yuzhou, et al.
Published: (2024)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)
by: Shi, Yiming, et al.
Published: (2024)
LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding
by: Xiao, Feng, et al.
Published: (2025)
by: Xiao, Feng, et al.
Published: (2025)
Similar Items
-
SegVol: Universal and Interactive Volumetric Medical Image Segmentation
by: Du, Yuxin, et al.
Published: (2023) -
Robust and Accurate Multi-view 2D/3D Image Registration with Differentiable X-ray Rendering and Dual Cross-view Constraints
by: Cui, Yuxin, et al.
Published: (2025) -
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2024) -
Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
by: Yu, Yang, et al.
Published: (2026) -
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)