Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhou, Yun, Wang, Yaoting, Jie, Guangquan, Liu, Jinyu, Ding, Henghui
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866917101487259648
author Zhou, Yun
Wang, Yaoting
Jie, Guangquan
Liu, Jinyu
Ding, Henghui
author_facet Zhou, Yun
Wang, Yaoting
Jie, Guangquan
Liu, Jinyu
Ding, Henghui
contents SAM3D has garnered widespread attention for its strong 3D object reconstruction capabilities. However, a key limitation remains: SAM3D cannot reconstruct specific objects referred to by textual descriptions, a capability that is essential for practical applications such as 3D editing, game development, and virtual environments. To address this gap, we introduce Ref-SAM3D, a simple yet effective extension to SAM3D that incorporates textual descriptions as a high-level prior, enabling text-guided 3D reconstruction from a single RGB image. Through extensive qualitative experiments, we show that Ref-SAM3D, guided only by natural language and a single 2D view, delivers competitive and high-fidelity zero-shot reconstruction performance. Our results demonstrate that Ref-SAM3D effectively bridges the gap between 2D visual cues and 3D geometric understanding, offering a more flexible and accessible paradigm for reference-guided 3D reconstruction. Code is available at: https://github.com/FudanCVL/Ref-SAM3D.
format Preprint
id arxiv_https___arxiv_org_abs_2511_19426
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
Zhou, Yun
Wang, Yaoting
Jie, Guangquan
Liu, Jinyu
Ding, Henghui
Computer Vision and Pattern Recognition
SAM3D has garnered widespread attention for its strong 3D object reconstruction capabilities. However, a key limitation remains: SAM3D cannot reconstruct specific objects referred to by textual descriptions, a capability that is essential for practical applications such as 3D editing, game development, and virtual environments. To address this gap, we introduce Ref-SAM3D, a simple yet effective extension to SAM3D that incorporates textual descriptions as a high-level prior, enabling text-guided 3D reconstruction from a single RGB image. Through extensive qualitative experiments, we show that Ref-SAM3D, guided only by natural language and a single 2D view, delivers competitive and high-fidelity zero-shot reconstruction performance. Our results demonstrate that Ref-SAM3D effectively bridges the gap between 2D visual cues and 3D geometric understanding, offering a more flexible and accessible paradigm for reference-guided 3D reconstruction. Code is available at: https://github.com/FudanCVL/Ref-SAM3D.
title Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2511.19426