Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Wenyue, Chen, Wenjue, Li, Peng, Wang, Qinghe, Jia, Xu, Zheng, Heliang, Jia, Rongfei, Liu, Yuan, Wang, Ronggang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Hyper3D: Efficient 3D Representation via Hybrid Triplane and Octree Feature for Enhanced 3D Shape Variational Auto-Encoders
by: Guo, Jingyu, et al.
Published: (2025)
by: Guo, Jingyu, et al.
Published: (2025)
SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
by: Chen, Wenyue, et al.
Published: (2025)
by: Chen, Wenyue, et al.
Published: (2025)
Hitem3D 2.0: Multi-View Guided Native 3D Texture Generation
by: He, Huiang, et al.
Published: (2026)
by: He, Huiang, et al.
Published: (2026)
Sparc3D: Sparse Representation and Construction for High-Resolution 3D Shapes Modeling
by: Li, Zhihao, et al.
Published: (2025)
by: Li, Zhihao, et al.
Published: (2025)
3D Aware Region Prompted Vision Language Model
by: Cheng, An-Chieh, et al.
Published: (2025)
by: Cheng, An-Chieh, et al.
Published: (2025)
From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach
by: Wang, Xilin, et al.
Published: (2024)
by: Wang, Xilin, et al.
Published: (2024)
3D Vision-Language Gaussian Splatting
by: Peng, Qucheng, et al.
Published: (2024)
by: Peng, Qucheng, et al.
Published: (2024)
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation
by: Wang, Qinghe, et al.
Published: (2025)
by: Wang, Qinghe, et al.
Published: (2025)
PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models
by: Su, Yuanhao, et al.
Published: (2026)
by: Su, Yuanhao, et al.
Published: (2026)
P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models
by: Jung, Geunyoung, et al.
Published: (2026)
by: Jung, Geunyoung, et al.
Published: (2026)
Exploiting Point-Language Models with Dual-Prompts for 3D Anomaly Detection
by: Wang, Jiaxiang, et al.
Published: (2025)
by: Wang, Jiaxiang, et al.
Published: (2025)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
by: Bai, Weimin, et al.
Published: (2025)
by: Bai, Weimin, et al.
Published: (2025)
EI-Part: Explode for Completion and Implode for Refinement
by: Sun, Wanhu, et al.
Published: (2026)
by: Sun, Wanhu, et al.
Published: (2026)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
by: Li, Zheng, et al.
Published: (2024)
by: Li, Zheng, et al.
Published: (2024)
Lightweight Multiplane Images Network for Real-Time Stereoscopic Conversion from Planar Video
by: Diao, Shanding, et al.
Published: (2024)
by: Diao, Shanding, et al.
Published: (2024)
V3D: Video Diffusion Models are Effective 3D Generators
by: Chen, Zilong, et al.
Published: (2024)
by: Chen, Zilong, et al.
Published: (2024)
3D Scene Creation and Rendering via Rough Meshes: A Lighting Transfer Avenue
by: Cai, Bowen, et al.
Published: (2022)
by: Cai, Bowen, et al.
Published: (2022)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
by: Liao, Liwei, et al.
Published: (2025)
by: Liao, Liwei, et al.
Published: (2025)
Boosting Single-domain Generalized Object Detection via Vision-Language Knowledge Interaction
by: Xu, Xiaoran, et al.
Published: (2025)
by: Xu, Xiaoran, et al.
Published: (2025)
Unifying 3D Vision-Language Understanding via Promptable Queries
by: Zhu, Ziyu, et al.
Published: (2024)
by: Zhu, Ziyu, et al.
Published: (2024)
Towards Foundation Models for 3D Vision: How Close Are We?
by: Zuo, Yiming, et al.
Published: (2024)
by: Zuo, Yiming, et al.
Published: (2024)
3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
by: Xu, Xiaoxu, et al.
Published: (2024)
by: Xu, Xiaoxu, et al.
Published: (2024)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
by: Zhang, Jiahui, et al.
Published: (2025)
by: Zhang, Jiahui, et al.
Published: (2025)
Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation
by: Seo, Junyoung, et al.
Published: (2023)
by: Seo, Junyoung, et al.
Published: (2023)
MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training
by: Ni, Xuefeng, et al.
Published: (2024)
by: Ni, Xuefeng, et al.
Published: (2024)
Text-to-3D Generation by 2D Editing
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
SecureGS: Boosting the Security and Fidelity of 3D Gaussian Splatting Steganography
by: Zhang, Xuanyu, et al.
Published: (2025)
by: Zhang, Xuanyu, et al.
Published: (2025)
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
by: Bai, Weimin, et al.
Published: (2025)
by: Bai, Weimin, et al.
Published: (2025)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
by: Liu, Kangcheng, et al.
Published: (2023)
by: Liu, Kangcheng, et al.
Published: (2023)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
A Dual-Augmentor Framework for Domain Generalization in 3D Human Pose Estimation
by: Peng, Qucheng, et al.
Published: (2024)
by: Peng, Qucheng, et al.
Published: (2024)
Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generation
by: Liu, Che, et al.
Published: (2024)
by: Liu, Che, et al.
Published: (2024)
Efficient Test-Time Prompt Tuning for Vision-Language Models
by: Zhu, Yuhan, et al.
Published: (2024)
by: Zhu, Yuhan, et al.
Published: (2024)
MagicNaming: Consistent Identity Generation by Finding a "Name Space" in T2I Diffusion Models
by: Zhao, Jing, et al.
Published: (2024)
by: Zhao, Jing, et al.
Published: (2024)
GAPrompt: Geometry-Aware Point Cloud Prompt for 3D Vision Model
by: Ai, Zixiang, et al.
Published: (2025)
by: Ai, Zixiang, et al.
Published: (2025)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
by: Zheng, Xinye, et al.
Published: (2026)
by: Zheng, Xinye, et al.
Published: (2026)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
by: Hai, Jia-Wei, et al.
Published: (2026)
by: Hai, Jia-Wei, et al.
Published: (2026)
EvSign: Sign Language Recognition and Translation with Streaming Events
by: Zhang, Pengyu, et al.
Published: (2024)
by: Zhang, Pengyu, et al.
Published: (2024)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
by: Chen, Anthony, et al.
Published: (2025)
by: Chen, Anthony, et al.
Published: (2025)
Similar Items
-
Hyper3D: Efficient 3D Representation via Hybrid Triplane and Octree Feature for Enhanced 3D Shape Variational Auto-Encoders
by: Guo, Jingyu, et al.
Published: (2025) -
SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
by: Chen, Wenyue, et al.
Published: (2025) -
Hitem3D 2.0: Multi-View Guided Native 3D Texture Generation
by: He, Huiang, et al.
Published: (2026) -
Sparc3D: Sparse Representation and Construction for High-Resolution 3D Shapes Modeling
by: Li, Zhihao, et al.
Published: (2025) -
3D Aware Region Prompted Vision Language Model
by: Cheng, An-Chieh, et al.
Published: (2025)