DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ates, Gorkem Can, Xin, Yu, Gong, Kuang, Shao, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
von: Xin, Yu, et al.
Veröffentlicht: (2025)
von: Xin, Yu, et al.
Veröffentlicht: (2025)
ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation
von: Xin, Yu, et al.
Veröffentlicht: (2026)
von: Xin, Yu, et al.
Veröffentlicht: (2026)
Dual Cross-Attention for Medical Image Segmentation
von: Ates, Gorkem Can, et al.
Veröffentlicht: (2023)
von: Ates, Gorkem Can, et al.
Veröffentlicht: (2023)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models
von: Gong, Yuxin, et al.
Veröffentlicht: (2025)
von: Gong, Yuxin, et al.
Veröffentlicht: (2025)
CDPDNet: Integrating Text Guidance with Hybrid Vision Encoders for Medical Image Segmentation
von: Wu, Jiong, et al.
Veröffentlicht: (2025)
von: Wu, Jiong, et al.
Veröffentlicht: (2025)
Geodesic Diffusion Models for Efficient Medical Image Enhancement
von: Zhang, Teng, et al.
Veröffentlicht: (2025)
von: Zhang, Teng, et al.
Veröffentlicht: (2025)
Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement
von: Jiang, Hongxu, et al.
Veröffentlicht: (2026)
von: Jiang, Hongxu, et al.
Veröffentlicht: (2026)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
GaussianOcc3D: A Gaussian-Based Adaptive Multi-modal 3D Occupancy Prediction
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
von: Lan, Mengcheng, et al.
Veröffentlicht: (2024)
von: Lan, Mengcheng, et al.
Veröffentlicht: (2024)
VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
von: Doruk, A. Enes, et al.
Veröffentlicht: (2026)
DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
von: He, Yulin, et al.
Veröffentlicht: (2026)
von: He, Yulin, et al.
Veröffentlicht: (2026)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
von: Wang, Chenhao, et al.
Veröffentlicht: (2026)
von: Wang, Chenhao, et al.
Veröffentlicht: (2026)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
Adaptive Whole-Body PET Image Denoising Using 3D Diffusion Models with ControlNet
von: Yu, Boxiao, et al.
Veröffentlicht: (2024)
von: Yu, Boxiao, et al.
Veröffentlicht: (2024)
Convolutional Initialization for Data-Efficient Vision Transformers
von: Zheng, Jianqiao, et al.
Veröffentlicht: (2024)
von: Zheng, Jianqiao, et al.
Veröffentlicht: (2024)
Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models
von: Jin, Hyundong, et al.
Veröffentlicht: (2026)
von: Jin, Hyundong, et al.
Veröffentlicht: (2026)
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
von: Jiang, Jerry, et al.
Veröffentlicht: (2026)
von: Jiang, Jerry, et al.
Veröffentlicht: (2026)
XPoint: A Self-Supervised Visual-State-Space based Architecture for Multispectral Image Registration
von: Yagmur, Ismail Can, et al.
Veröffentlicht: (2024)
von: Yagmur, Ismail Can, et al.
Veröffentlicht: (2024)
Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models
von: Wang, Haoming, et al.
Veröffentlicht: (2026)
von: Wang, Haoming, et al.
Veröffentlicht: (2026)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
von: Chae, Hyunsik, et al.
Veröffentlicht: (2025)
von: Chae, Hyunsik, et al.
Veröffentlicht: (2025)
3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds
von: Sun, Fan-Yun, et al.
Veröffentlicht: (2025)
von: Sun, Fan-Yun, et al.
Veröffentlicht: (2025)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
von: Zhan, Yu-Wei, et al.
Veröffentlicht: (2023)
von: Zhan, Yu-Wei, et al.
Veröffentlicht: (2023)
An Efficient 3D Convolutional Neural Network with Channel-wise, Spatial-grouped, and Temporal Convolutions
von: Wang, Zhe, et al.
Veröffentlicht: (2025)
von: Wang, Zhe, et al.
Veröffentlicht: (2025)
3D Question Answering via only 2D Vision-Language Models
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
TransAdapter: Vision Transformer for Feature-Centric Unsupervised Domain Adaptation
von: Doruk, A. Enes, et al.
Veröffentlicht: (2024)
von: Doruk, A. Enes, et al.
Veröffentlicht: (2024)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
von: Yoon, Hee Suk, et al.
Veröffentlicht: (2026)
von: Yoon, Hee Suk, et al.
Veröffentlicht: (2026)
KIND: Knowledge Integration and Diversion for Training Decomposable Models
von: Xie, Yucheng, et al.
Veröffentlicht: (2024)
von: Xie, Yucheng, et al.
Veröffentlicht: (2024)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
von: Huang, Wencan, et al.
Veröffentlicht: (2025)
von: Huang, Wencan, et al.
Veröffentlicht: (2025)
Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches
von: Yu, Qing, et al.
Veröffentlicht: (2024)
von: Yu, Qing, et al.
Veröffentlicht: (2024)
InstantStyleGaussian: Efficient Art Style Transfer with 3D Gaussian Splatting
von: Yu, Xin-Yi, et al.
Veröffentlicht: (2024)
von: Yu, Xin-Yi, et al.
Veröffentlicht: (2024)
StdGEN: Semantic-Decomposed 3D Character Generation from Single Images
von: He, Yuze, et al.
Veröffentlicht: (2024)
von: He, Yuze, et al.
Veröffentlicht: (2024)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
von: Huang, Hsiang-Wei, et al.
Veröffentlicht: (2026)
Efficient Dynamic Attention 3D Convolution for Hyperspectral Image Classification
von: Li, Guandong, et al.
Veröffentlicht: (2025)
von: Li, Guandong, et al.
Veröffentlicht: (2025)
Efficient 3D Recognition with Event-driven Spike Sparse Convolution
von: Qiu, Xuerui, et al.
Veröffentlicht: (2024)
von: Qiu, Xuerui, et al.
Veröffentlicht: (2024)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
von: Shang, Zhenhao, et al.
Veröffentlicht: (2026)
von: Shang, Zhenhao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
von: Xin, Yu, et al.
Veröffentlicht: (2025) -
ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation
von: Xin, Yu, et al.
Veröffentlicht: (2026) -
Dual Cross-Attention for Medical Image Segmentation
von: Ates, Gorkem Can, et al.
Veröffentlicht: (2023) -
D-Attn: Decomposed Attention for Large Vision-and-Language Models
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025) -
TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models
von: Gong, Yuxin, et al.
Veröffentlicht: (2025)