Transcrib3D: 3D Referring Expression Resolution through Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Fang, Jiading, Tan, Xiangshan, Lin, Shengjie, Vasiljevic, Igor, Guizilini, Vitor, Mei, Hongyuan, Ambrus, Rares, Shakhnarovich, Gregory, Walter, Matthew R |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SplArt: Articulation Estimation and Part-Level Reconstruction with 3D Gaussian Splatting
by: Lin, Shengjie, et al.
Published: (2025)
by: Lin, Shengjie, et al.
Published: (2025)
Incorporating dense metric depth into neural 3D representations for view synthesis and relighting
by: Chaudhury, Arkadeep Narayan, et al.
Published: (2024)
by: Chaudhury, Arkadeep Narayan, et al.
Published: (2024)
Zero-Shot Novel View and Depth Synthesis with Multi-View Geometric Diffusion
by: Guizilini, Vitor, et al.
Published: (2025)
by: Guizilini, Vitor, et al.
Published: (2025)
Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning
by: Jiang, Tianchong, et al.
Published: (2025)
by: Jiang, Tianchong, et al.
Published: (2025)
FastMap: Revisiting Structure from Motion through First-Order Optimization
by: Li, Jiahao, et al.
Published: (2025)
by: Li, Jiahao, et al.
Published: (2025)
GRIN: Zero-Shot Metric Depth with Pixel-Level Diffusion
by: Guizilini, Vitor, et al.
Published: (2024)
by: Guizilini, Vitor, et al.
Published: (2024)
NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance Fields
by: Irshad, Muhammad Zubair, et al.
Published: (2024)
by: Irshad, Muhammad Zubair, et al.
Published: (2024)
Self-Supervised Geometry-Guided Initialization for Robust Monocular Visual Odometry
by: Kanai, Takayuki, et al.
Published: (2024)
by: Kanai, Takayuki, et al.
Published: (2024)
$SE(3)$ Equivariant Ray Embeddings for Implicit Multi-View Depth Estimation
by: Xu, Yinshuang, et al.
Published: (2024)
by: Xu, Yinshuang, et al.
Published: (2024)
Zero-Shot Multi-Object Scene Completion
by: Iwase, Shun, et al.
Published: (2024)
by: Iwase, Shun, et al.
Published: (2024)
OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
by: Liu, Katherine, et al.
Published: (2025)
by: Liu, Katherine, et al.
Published: (2025)
Statler: State-Maintaining Language Models for Embodied Reasoning
by: Yoneda, Takuma, et al.
Published: (2023)
by: Yoneda, Takuma, et al.
Published: (2023)
Understanding Complexity in VideoQA via Visual Program Generation
by: Eyzaguirre, Cristobal, et al.
Published: (2025)
by: Eyzaguirre, Cristobal, et al.
Published: (2025)
Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning
by: Fang, Jiading
Published: (2025)
by: Fang, Jiading
Published: (2025)
ZeroGrasp: Zero-Shot Shape Reconstruction Enabled Robotic Grasping
by: Iwase, Shun, et al.
Published: (2025)
by: Iwase, Shun, et al.
Published: (2025)
3D-GRES: Generalized 3D Referring Expression Segmentation
by: Wu, Changli, et al.
Published: (2024)
by: Wu, Changli, et al.
Published: (2024)
3D-DRES: Detailed 3D Referring Expression Segmentation
by: Chen, Qi, et al.
Published: (2026)
by: Chen, Qi, et al.
Published: (2026)
MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models
by: Ding, Peng, et al.
Published: (2024)
by: Ding, Peng, et al.
Published: (2024)
SIRE: SE(3) Intrinsic Rigidity Embeddings
by: Smith, Cameron, et al.
Published: (2025)
by: Smith, Cameron, et al.
Published: (2025)
HapCompass: A Rotational Haptic Device for Contact-Rich Robotic Teleoperation
by: Tan, Xiangshan, et al.
Published: (2026)
by: Tan, Xiangshan, et al.
Published: (2026)
Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
by: Yu, Keunwoo Peter, et al.
Published: (2024)
by: Yu, Keunwoo Peter, et al.
Published: (2024)
ReFiNe: Recursive Field Networks for Cross-modal Multi-scene Representation
by: Zakharov, Sergey, et al.
Published: (2024)
by: Zakharov, Sergey, et al.
Published: (2024)
Towards Realistic Scene Generation with LiDAR Diffusion Models
by: Ran, Haoxi, et al.
Published: (2024)
by: Ran, Haoxi, et al.
Published: (2024)
Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation
by: Zhou, Keshen, et al.
Published: (2026)
by: Zhou, Keshen, et al.
Published: (2026)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
by: Chen, Wenxin, et al.
Published: (2025)
by: Chen, Wenxin, et al.
Published: (2025)
AnyView: Synthesizing Any Novel View in Dynamic Scenes
by: Van Hoorick, Basile, et al.
Published: (2026)
by: Van Hoorick, Basile, et al.
Published: (2026)
Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis
by: Chen, Hongyuan, et al.
Published: (2026)
by: Chen, Hongyuan, et al.
Published: (2026)
Understanding Video Transformers via Universal Concept Discovery
by: Kowal, Matthew, et al.
Published: (2024)
by: Kowal, Matthew, et al.
Published: (2024)
TOGGL: Transcribing Overlapping Speech with Staggered Labeling
by: Li, Chak-Fai, et al.
Published: (2024)
by: Li, Chak-Fai, et al.
Published: (2024)
InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior
by: Wen, Minghao, et al.
Published: (2025)
by: Wen, Minghao, et al.
Published: (2025)
SMIRK: 3D Facial Expressions through Analysis-by-Neural-Synthesis
by: Retsinas, George, et al.
Published: (2024)
by: Retsinas, George, et al.
Published: (2024)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
by: Wu, Changli, et al.
Published: (2026)
by: Wu, Changli, et al.
Published: (2026)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
by: Yang, Haibo, et al.
Published: (2024)
by: Yang, Haibo, et al.
Published: (2024)
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
by: Chen, Qi, et al.
Published: (2025)
by: Chen, Qi, et al.
Published: (2025)
TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting
by: Tan, Yuyang, et al.
Published: (2026)
by: Tan, Yuyang, et al.
Published: (2026)
Fiducial Exoskeletons: Image-Centric Robot State Estimation
by: Smith, Cameron, et al.
Published: (2026)
by: Smith, Cameron, et al.
Published: (2026)
Speech LLMs are Contextual Reasoning Transcribers
by: Deng, Keqi, et al.
Published: (2026)
by: Deng, Keqi, et al.
Published: (2026)
Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension
by: Guan, Runwei, et al.
Published: (2024)
by: Guan, Runwei, et al.
Published: (2024)
3D Gaussian Blendshapes for Head Avatar Animation
by: Ma, Shengjie, et al.
Published: (2024)
by: Ma, Shengjie, et al.
Published: (2024)
Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
by: Zhou, Yun, et al.
Published: (2025)
by: Zhou, Yun, et al.
Published: (2025)
Similar Items
-
SplArt: Articulation Estimation and Part-Level Reconstruction with 3D Gaussian Splatting
by: Lin, Shengjie, et al.
Published: (2025) -
Incorporating dense metric depth into neural 3D representations for view synthesis and relighting
by: Chaudhury, Arkadeep Narayan, et al.
Published: (2024) -
Zero-Shot Novel View and Depth Synthesis with Multi-View Geometric Diffusion
by: Guizilini, Vitor, et al.
Published: (2025) -
Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning
by: Jiang, Tianchong, et al.
Published: (2025) -
FastMap: Revisiting Structure from Motion through First-Order Optimization
by: Li, Jiahao, et al.
Published: (2025)