VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haochen, Zantout, Nader, Kachana, Pujith, Wu, Zongyuan, Zhang, Ji, Wang, Wenshan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes
por: Zhang, Haochen, et al.
Publicado: (2025)
por: Zhang, Haochen, et al.
Publicado: (2025)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
por: Zantout, Nader, et al.
Publicado: (2025)
por: Zantout, Nader, et al.
Publicado: (2025)
Beyond Uncertainty: Risk-Aware Active View Acquisition for Safe Robot Navigation and 3D Scene Understanding with FisherRF
por: Liu, Guangyi, et al.
Publicado: (2024)
por: Liu, Guangyi, et al.
Publicado: (2024)
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
por: Huang, Jiaxin, et al.
Publicado: (2025)
por: Huang, Jiaxin, et al.
Publicado: (2025)
Language-Assisted 3D Scene Understanding
por: Wu, Yanmin, et al.
Publicado: (2023)
por: Wu, Yanmin, et al.
Publicado: (2023)
Semantic2D: Enabling Semantic Scene Understanding with 2D Lidar Alone
por: Xie, Zhanteng, et al.
Publicado: (2024)
por: Xie, Zhanteng, et al.
Publicado: (2024)
OGScene3D: Incremental Open-Vocabulary 3D Gaussian Scene Graph Mapping for Scene Understanding
por: Zhu, Siting, et al.
Publicado: (2026)
por: Zhu, Siting, et al.
Publicado: (2026)
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
por: Fan, Xianzhe, et al.
Publicado: (2026)
por: Fan, Xianzhe, et al.
Publicado: (2026)
MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation
por: Al-Bustami, Ali, et al.
Publicado: (2026)
por: Al-Bustami, Ali, et al.
Publicado: (2026)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph
por: Niu, Haochen, et al.
Publicado: (2026)
por: Niu, Haochen, et al.
Publicado: (2026)
QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding
por: Mehan, Yash, et al.
Publicado: (2024)
por: Mehan, Yash, et al.
Publicado: (2024)
Rig3R: Rig-Aware Conditioning for Learned 3D Reconstruction
por: Li, Samuel, et al.
Publicado: (2025)
por: Li, Samuel, et al.
Publicado: (2025)
OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation
por: Jiang, Haochen, et al.
Publicado: (2024)
por: Jiang, Haochen, et al.
Publicado: (2024)
Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN
por: Xia, Ziyi, et al.
Publicado: (2026)
por: Xia, Ziyi, et al.
Publicado: (2026)
Collaborative Dynamic 3D Scene Graphs for Open-Vocabulary Urban Scene Understanding
por: Steinke, Tim, et al.
Publicado: (2025)
por: Steinke, Tim, et al.
Publicado: (2025)
Interactive-FAR:Interactive, Fast and Adaptable Routing for Navigation Among Movable Obstacles in Complex Unknown Environments
por: He, Botao, et al.
Publicado: (2024)
por: He, Botao, et al.
Publicado: (2024)
Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding
por: Kong, Lingdong, et al.
Publicado: (2024)
por: Kong, Lingdong, et al.
Publicado: (2024)
SGFormer: Satellite-Ground Fusion for 3D Semantic Scene Completion
por: Guo, Xiyue, et al.
Publicado: (2025)
por: Guo, Xiyue, et al.
Publicado: (2025)
DreamUp3D: Object-Centric Generative Models for Single-View 3D Scene Understanding and Real-to-Sim Transfer
por: Wu, Yizhe, et al.
Publicado: (2024)
por: Wu, Yizhe, et al.
Publicado: (2024)
STRIVE: Structured Representation Integrating VLM Reasoning for Efficient Object Navigation
por: Zhu, Haokun, et al.
Publicado: (2025)
por: Zhu, Haokun, et al.
Publicado: (2025)
ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation
por: Wu, You, et al.
Publicado: (2026)
por: Wu, You, et al.
Publicado: (2026)
3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models
por: Yu, Bin, et al.
Publicado: (2026)
por: Yu, Bin, et al.
Publicado: (2026)
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
por: Wu, Xianjin, et al.
Publicado: (2026)
por: Wu, Xianjin, et al.
Publicado: (2026)
RoboOcc: Enhancing the Geometric and Semantic Scene Understanding for Robots
por: Zhang, Zhang, et al.
Publicado: (2025)
por: Zhang, Zhang, et al.
Publicado: (2025)
Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
por: Li, Haoyuan, et al.
Publicado: (2025)
por: Li, Haoyuan, et al.
Publicado: (2025)
MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation
por: Huang, Xun, et al.
Publicado: (2025)
por: Huang, Xun, et al.
Publicado: (2025)
Real-time 3D Semantic Scene Perception for Egocentric Robots with Binocular Vision
por: Nguyen, K., et al.
Publicado: (2024)
por: Nguyen, K., et al.
Publicado: (2024)
MM-Gaussian: 3D Gaussian-based Multi-modal Fusion for Localization and Reconstruction in Unbounded Scenes
por: Wu, Chenyang, et al.
Publicado: (2024)
por: Wu, Chenyang, et al.
Publicado: (2024)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
por: Zhang, Lingfeng, et al.
Publicado: (2025)
por: Zhang, Lingfeng, et al.
Publicado: (2025)
On Deep Learning for Geometric and Semantic Scene Understanding Using On-Vehicle 3D LiDAR
por: Li, Li
Publicado: (2024)
por: Li, Li
Publicado: (2024)
Beyond Geometry: Efficient Topologically-Grounded Navigation in Complex 3D Environments
por: Du, Yifan, et al.
Publicado: (2026)
por: Du, Yifan, et al.
Publicado: (2026)
Semantically Safe Robot Manipulation: From Semantic Scene Understanding to Motion Safeguards
por: Brunke, Lukas, et al.
Publicado: (2024)
por: Brunke, Lukas, et al.
Publicado: (2024)
NavDreamer: Video Models as Zero-Shot 3D Navigators
por: Huang, Xijie, et al.
Publicado: (2026)
por: Huang, Xijie, et al.
Publicado: (2026)
SMART-3D: Three-Dimensional Self-Morphing Adaptive Replanning Tree
por: Agrawal, Priyanshu, et al.
Publicado: (2025)
por: Agrawal, Priyanshu, et al.
Publicado: (2025)
RayFronts: Open-Set Semantic Ray Frontiers for Online Scene Understanding and Exploration
por: Alama, Omar, et al.
Publicado: (2025)
por: Alama, Omar, et al.
Publicado: (2025)
STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation
por: Park, Konyul, et al.
Publicado: (2026)
por: Park, Konyul, et al.
Publicado: (2026)
TartanGround: A Large-Scale Dataset for Ground Robot Perception and Navigation
por: Patel, Manthan, et al.
Publicado: (2025)
por: Patel, Manthan, et al.
Publicado: (2025)
Ejemplares similares
-
IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes
por: Zhang, Haochen, et al.
Publicado: (2025) -
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
por: Zantout, Nader, et al.
Publicado: (2025) -
Beyond Uncertainty: Risk-Aware Active View Acquisition for Safe Robot Navigation and 3D Scene Understanding with FisherRF
por: Liu, Guangyi, et al.
Publicado: (2024) -
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
por: Huang, Jiaxin, et al.
Publicado: (2025) -
Language-Assisted 3D Scene Understanding
por: Wu, Yanmin, et al.
Publicado: (2023)