Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Yufei, Zheng, Jie, Meng, Qianke, Yu, Zhou, Chen, Minghao, Ding, Jiajun, Tan, Min, Xi, Yuling, Chen, Zhiwen, Lv, Chengfei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
by: Yin, Yufei, et al.
Published: (2025)
by: Yin, Yufei, et al.
Published: (2025)
Z3D: Zero-Shot 3D Visual Grounding from Images
by: Drozdov, Nikita, et al.
Published: (2026)
by: Drozdov, Nikita, et al.
Published: (2026)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
by: Yin, Yufei, et al.
Published: (2026)
by: Yin, Yufei, et al.
Published: (2026)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
by: Xu, Runsen, et al.
Published: (2024)
by: Xu, Runsen, et al.
Published: (2024)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
by: Li, Rong, et al.
Published: (2024)
by: Li, Rong, et al.
Published: (2024)
Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3D
by: T, Mukund Varma, et al.
Published: (2024)
by: T, Mukund Varma, et al.
Published: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
by: Liao, Liwei, et al.
Published: (2025)
by: Liao, Liwei, et al.
Published: (2025)
Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems
by: Yuan, Qihao, et al.
Published: (2024)
by: Yuan, Qihao, et al.
Published: (2024)
Zero-Shot 3D Visual Grounding from Vision-Language Models
by: Li, Rong, et al.
Published: (2025)
by: Li, Rong, et al.
Published: (2025)
FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures
by: Sun, Yujie, et al.
Published: (2026)
by: Sun, Yujie, et al.
Published: (2026)
TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting
by: Chen, Jianchuan, et al.
Published: (2025)
by: Chen, Jianchuan, et al.
Published: (2025)
ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation
by: Min, Yunhong, et al.
Published: (2025)
by: Min, Yunhong, et al.
Published: (2025)
ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation
by: Zhou, Yuan, et al.
Published: (2025)
by: Zhou, Yuan, et al.
Published: (2025)
GeoLoco: Leveraging 3D Geometric Priors from Visual Foundation Model for Robust RGB-Only Humanoid Locomotion
by: Liu, Yufei, et al.
Published: (2026)
by: Liu, Yufei, et al.
Published: (2026)
D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement
by: Wang, Yixuan, et al.
Published: (2023)
by: Wang, Yixuan, et al.
Published: (2023)
DGE: Direct Gaussian 3D Editing by Consistent Multi-view Editing
by: Chen, Minghao, et al.
Published: (2024)
by: Chen, Minghao, et al.
Published: (2024)
BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
by: Zhou, Zibo, et al.
Published: (2025)
by: Zhou, Zibo, et al.
Published: (2025)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
by: Lin, Jiawen, et al.
Published: (2025)
by: Lin, Jiawen, et al.
Published: (2025)
AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
by: Huynh, Cuong, et al.
Published: (2026)
by: Huynh, Cuong, et al.
Published: (2026)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
by: Zantout, Nader, et al.
Published: (2025)
by: Zantout, Nader, et al.
Published: (2025)
Zero-Shot UAV Navigation in Forests via Relightable 3D Gaussian Splatting
by: Lv, Zinan, et al.
Published: (2026)
by: Lv, Zinan, et al.
Published: (2026)
SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation
by: Xu, Mutian, et al.
Published: (2023)
by: Xu, Mutian, et al.
Published: (2023)
Global solutions of the 3D incompressible inhomogeneous viscoelastic system
by: Ai, Chengfei, et al.
Published: (2024)
by: Ai, Chengfei, et al.
Published: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
by: Wang, Haibo, et al.
Published: (2026)
by: Wang, Haibo, et al.
Published: (2026)
SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
by: Sun, Xuefei, et al.
Published: (2026)
by: Sun, Xuefei, et al.
Published: (2026)
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
by: Yu, Hongyun, et al.
Published: (2024)
by: Yu, Hongyun, et al.
Published: (2024)
Agent3D-Zero: An Agent for Zero-shot 3D Understanding
by: Zhang, Sha, et al.
Published: (2024)
by: Zhang, Sha, et al.
Published: (2024)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
by: Yuan, Zhihao, et al.
Published: (2023)
by: Yuan, Zhihao, et al.
Published: (2023)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
by: Feng, Chun, et al.
Published: (2024)
by: Feng, Chun, et al.
Published: (2024)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
by: Chen, Tianrun, et al.
Published: (2024)
by: Chen, Tianrun, et al.
Published: (2024)
MCL-AD: Multimodal Collaboration Learning for Zero-Shot 3D Anomaly Detection
by: Li, Gang, et al.
Published: (2025)
by: Li, Gang, et al.
Published: (2025)
Sketch3D: Style-Consistent Guidance for Sketch-to-3D Generation
by: Zheng, Wangguandong, et al.
Published: (2024)
by: Zheng, Wangguandong, et al.
Published: (2024)
Reasoning Matters for 3D Visual Grounding
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior
by: Wen, Minghao, et al.
Published: (2025)
by: Wen, Minghao, et al.
Published: (2025)
Visual-Semantic Graph Matching Net for Zero-Shot Learning
by: Duan, Bowen, et al.
Published: (2024)
by: Duan, Bowen, et al.
Published: (2024)
Zero-P-to-3: Zero-Shot Partial-View Images to 3D Object
by: Lin, Yuxuan, et al.
Published: (2025)
by: Lin, Yuxuan, et al.
Published: (2025)
Unified Representation Space for 3D Visual Grounding
by: Zheng, Yinuo, et al.
Published: (2025)
by: Zheng, Yinuo, et al.
Published: (2025)
Dual Enhancement on 3D Vision-Language Perception for Monocular 3D Visual Grounding
by: Li, Yuzhen, et al.
Published: (2025)
by: Li, Yuzhen, et al.
Published: (2025)
Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation
by: Seo, Junyoung, et al.
Published: (2023)
by: Seo, Junyoung, et al.
Published: (2023)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
Similar Items
-
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
by: Yin, Yufei, et al.
Published: (2025) -
Z3D: Zero-Shot 3D Visual Grounding from Images
by: Drozdov, Nikita, et al.
Published: (2026) -
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
by: Yin, Yufei, et al.
Published: (2026) -
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
by: Xu, Runsen, et al.
Published: (2024) -
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
by: Li, Rong, et al.
Published: (2024)