Open-Set 3D Semantic Instance Maps for Vision Language Navigation -- O3D-SIM
Fuente:
arXiv
Saved in:
| Main Authors: | Nanwani, Laksh, Gupta, Kumaraditya, Mathur, Aditya, Agrawal, Swayam, Hafez, A. H. Abdul, Krishna, K. Madhava |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding
by: Mehan, Yash, et al.
Published: (2024)
by: Mehan, Yash, et al.
Published: (2024)
Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation
by: Singha, Antareep, et al.
Published: (2026)
by: Singha, Antareep, et al.
Published: (2026)
CrowdSurfer: Sampling Optimization Augmented with Vector-Quantized Variational AutoEncoder for Dense Crowd Navigation
by: Kumar, Naman, et al.
Published: (2024)
by: Kumar, Naman, et al.
Published: (2024)
SparseLoc: Sparse Open-Set Landmark-based Global Localization for Autonomous Navigation
by: Paul, Pranjal, et al.
Published: (2025)
by: Paul, Pranjal, et al.
Published: (2025)
MASt3R-Nav: WayPixel Navigation in Relative 3D Maps
by: Garg, Vansh, et al.
Published: (2026)
by: Garg, Vansh, et al.
Published: (2026)
OpenLex3D: A Tiered Evaluation Benchmark for Open-Vocabulary 3D Scene Representations
by: Kassab, Christina, et al.
Published: (2025)
by: Kassab, Christina, et al.
Published: (2025)
MonoMPC: Monocular Vision Based Navigation with Learned Collision Model and Risk-Aware Model Predictive Control
by: Sharma, Basant, et al.
Published: (2025)
by: Sharma, Basant, et al.
Published: (2025)
FUS3DMaps: Scalable and Accurate Open-Vocabulary Semantic Mapping by 3D Fusion of Voxel- and Instance-Level Layers
by: Homberger, Timon, et al.
Published: (2026)
by: Homberger, Timon, et al.
Published: (2026)
ATPPNet: Attention based Temporal Point cloud Prediction Network
by: Pal, Kaustab, et al.
Published: (2024)
by: Pal, Kaustab, et al.
Published: (2024)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
by: Li, Kailing, et al.
Published: (2026)
by: Li, Kailing, et al.
Published: (2026)
Imagine-2-Drive: Leveraging High-Fidelity World Models via Multi-Modal Diffusion Policies
by: Garg, Anant, et al.
Published: (2024)
by: Garg, Anant, et al.
Published: (2024)
Real-Time 3D Vision-Language Embedding Mapping
by: Rauch, Christian, et al.
Published: (2025)
by: Rauch, Christian, et al.
Published: (2025)
VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation
by: Zhang, Haochen, et al.
Published: (2024)
by: Zhang, Haochen, et al.
Published: (2024)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
by: Zhang, Lingfeng, et al.
Published: (2025)
by: Zhang, Lingfeng, et al.
Published: (2025)
Towards Global Localization using Multi-Modal Object-Instance Re-Identification
by: Chavan, Aneesh, et al.
Published: (2024)
by: Chavan, Aneesh, et al.
Published: (2024)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
by: Gao, Jianzhe, et al.
Published: (2026)
by: Gao, Jianzhe, et al.
Published: (2026)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation Models
by: Liu, Chuhao, et al.
Published: (2024)
by: Liu, Chuhao, et al.
Published: (2024)
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
OpenVLN: Open-world Aerial Vision-Language Navigation
by: Lin, Peican, et al.
Published: (2025)
by: Lin, Peican, et al.
Published: (2025)
OpenIN: Open-Vocabulary Instance-Oriented Navigation in Dynamic Domestic Environments
by: Tang, Yujie, et al.
Published: (2025)
by: Tang, Yujie, et al.
Published: (2025)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
by: Xia, Zhongyu, et al.
Published: (2026)
by: Xia, Zhongyu, et al.
Published: (2026)
Object Instance Retrieval in Assistive Robotics: Leveraging Fine-Tuned SimSiam with Multi-View Images Based on 3D Semantic Map
by: Sakaguchi, Taichi, et al.
Published: (2024)
by: Sakaguchi, Taichi, et al.
Published: (2024)
MetricGold: Leveraging Text-To-Image Latent Diffusion Models for Metric Depth Estimation
by: Shah, Ansh, et al.
Published: (2024)
by: Shah, Ansh, et al.
Published: (2024)
A Scene Graph Backed Approach to Open Set Semantic Mapping
by: Günther, Martin, et al.
Published: (2026)
by: Günther, Martin, et al.
Published: (2026)
Real-time 3D Semantic Scene Perception for Egocentric Robots with Binocular Vision
by: Nguyen, K., et al.
Published: (2024)
by: Nguyen, K., et al.
Published: (2024)
Agentic Scene Policies: Unifying Space, Semantics, and Affordances for Robot Action
by: Morin, Sacha, et al.
Published: (2025)
by: Morin, Sacha, et al.
Published: (2025)
Hierarchical Scoring with 3D Gaussian Splatting for Instance Image-Goal Navigation
by: Deng, Yijie, et al.
Published: (2025)
by: Deng, Yijie, et al.
Published: (2025)
OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models
by: Kuang, Yuxuan, et al.
Published: (2024)
by: Kuang, Yuxuan, et al.
Published: (2024)
SMART-3D: Three-Dimensional Self-Morphing Adaptive Replanning Tree
by: Agrawal, Priyanshu, et al.
Published: (2025)
by: Agrawal, Priyanshu, et al.
Published: (2025)
OGScene3D: Incremental Open-Vocabulary 3D Gaussian Scene Graph Mapping for Scene Understanding
by: Zhu, Siting, et al.
Published: (2026)
by: Zhu, Siting, et al.
Published: (2026)
BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
by: Zhou, Zibo, et al.
Published: (2025)
by: Zhou, Zibo, et al.
Published: (2025)
DualMap: Online Open-Vocabulary Semantic Mapping for Natural Language Navigation in Dynamic Changing Scenes
by: Jiang, Jiajun, et al.
Published: (2025)
by: Jiang, Jiajun, et al.
Published: (2025)
LeGo-Drive: Language-enhanced Goal-oriented Closed-Loop End-to-End Autonomous Driving
by: Paul, Pranjal, et al.
Published: (2024)
by: Paul, Pranjal, et al.
Published: (2024)
SplatSearch: Instance Image Goal Navigation for Mobile Robots using 3D Gaussian Splatting and Diffusion Models
by: Narasimhan, Siddarth, et al.
Published: (2025)
by: Narasimhan, Siddarth, et al.
Published: (2025)
Imagine2Servo: Intelligent Visual Servoing with Diffusion-Driven Goal Generation for Robotic Tasks
by: Pathre, Pranjali, et al.
Published: (2024)
by: Pathre, Pranjali, et al.
Published: (2024)
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
by: Wang, Shuo, et al.
Published: (2025)
by: Wang, Shuo, et al.
Published: (2025)
Look to Locate: Vision-Based Multisensory Navigation with 3-D Digital Maps for GNSS-Challenged Environments
by: Elmaghraby, Ola, et al.
Published: (2025)
by: Elmaghraby, Ola, et al.
Published: (2025)
Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps
by: Qiu, Dicong, et al.
Published: (2024)
by: Qiu, Dicong, et al.
Published: (2024)
Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving
by: Gupta, Keshav, et al.
Published: (2025)
by: Gupta, Keshav, et al.
Published: (2025)
Similar Items
-
QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding
by: Mehan, Yash, et al.
Published: (2024) -
Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation
by: Singha, Antareep, et al.
Published: (2026) -
CrowdSurfer: Sampling Optimization Augmented with Vector-Quantized Variational AutoEncoder for Dense Crowd Navigation
by: Kumar, Naman, et al.
Published: (2024) -
SparseLoc: Sparse Open-Set Landmark-based Global Localization for Autonomous Navigation
by: Paul, Pranjal, et al.
Published: (2025) -
MASt3R-Nav: WayPixel Navigation in Relative 3D Maps
by: Garg, Vansh, et al.
Published: (2026)