Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Ziyu, Wang, Xilin, Li, Yixuan, Zhang, Zhuofan, Ma, Xiaojian, Chen, Yixin, Jia, Baoxiong, Liang, Wei, Yu, Qian, Deng, Zhidong, Huang, Siyuan, Li, Qing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Task-oriented Sequential Grounding and Navigation in 3D Scenes
par: Zhang, Zhuofan, et autres
Publié: (2024)
par: Zhang, Zhuofan, et autres
Publié: (2024)
Unifying 3D Vision-Language Understanding via Promptable Queries
par: Zhu, Ziyu, et autres
Publié: (2024)
par: Zhu, Ziyu, et autres
Publié: (2024)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
par: Jia, Baoxiong, et autres
Publié: (2024)
par: Jia, Baoxiong, et autres
Publié: (2024)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2025)
par: Linghu, Xiongkun, et autres
Publié: (2025)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
par: Yang, Yandan, et autres
Publié: (2024)
par: Yang, Yandan, et autres
Publié: (2024)
From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes
par: Wang, Tianxu, et autres
Publié: (2025)
par: Wang, Tianxu, et autres
Publié: (2025)
LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning
par: Huang, Jiangyong, et autres
Publié: (2025)
par: Huang, Jiangyong, et autres
Publié: (2025)
Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance
par: Wang, Zan, et autres
Publié: (2024)
par: Wang, Zan, et autres
Publié: (2024)
Multi-modal Situated Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2024)
par: Linghu, Xiongkun, et autres
Publié: (2024)
An Embodied Generalist Agent in 3D World
par: Huang, Jiangyong, et autres
Publié: (2023)
par: Huang, Jiangyong, et autres
Publié: (2023)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
par: Linghu, Xiongkun, et autres
Publié: (2026)
par: Linghu, Xiongkun, et autres
Publié: (2026)
LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations
par: Lin, Yutang, et autres
Publié: (2026)
par: Lin, Yutang, et autres
Publié: (2026)
SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
par: Yang, Yandan, et autres
Publié: (2025)
par: Yang, Yandan, et autres
Publié: (2025)
Key-Gram: Extensible World Knowledge for Embodied Manipulation
par: Fan, Jingjing, et autres
Publié: (2026)
par: Fan, Jingjing, et autres
Publié: (2026)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
SlotLifter: Slot-guided Feature Lifting for Learning Object-centric Radiance Fields
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-Analysis
par: Huang, Jiangyong, et autres
Publié: (2025)
par: Huang, Jiangyong, et autres
Publié: (2025)
MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor Scenes
par: Lu, Ruijie, et autres
Publié: (2024)
par: Lu, Ruijie, et autres
Publié: (2024)
MetaScenes: Towards Automated Replica Creation for Real-world 3D Scans
par: Yu, Huangyue, et autres
Publié: (2025)
par: Yu, Huangyue, et autres
Publié: (2025)
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
par: Chen, Yixin, et autres
Publié: (2026)
par: Chen, Yixin, et autres
Publié: (2026)
Plan in Sandbox, Navigate in Open Worlds: Learning Physics-Grounded Abstracted Experience for Embodied Navigation
par: Shen, Zhixuan, et autres
Publié: (2026)
par: Shen, Zhixuan, et autres
Publié: (2026)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
par: Zhao, Yanpeng, et autres
Publié: (2026)
par: Zhao, Yanpeng, et autres
Publié: (2026)
Embodied Agents for Efficient Exploration and Smart Scene Description
par: Bigazzi, Roberto, et autres
Publié: (2023)
par: Bigazzi, Roberto, et autres
Publié: (2023)
Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation
par: Chen, Peixin, et autres
Publié: (2026)
par: Chen, Peixin, et autres
Publié: (2026)
Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting
par: Guo, Jun, et autres
Publié: (2024)
par: Guo, Jun, et autres
Publié: (2024)
Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
par: Wang, Zan, et autres
Publié: (2025)
par: Wang, Zan, et autres
Publié: (2025)
GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
par: Lu, Guanxing, et autres
Publié: (2025)
par: Lu, Guanxing, et autres
Publié: (2025)
Learning a Unified Policy for Position and Force Control in Legged Loco-Manipulation
par: Zhi, Peiyuan, et autres
Publié: (2025)
par: Zhi, Peiyuan, et autres
Publié: (2025)
SignScene: Visual Sign Grounding for Mapless Navigation
par: Zimmerman, Nicky, et autres
Publié: (2026)
par: Zimmerman, Nicky, et autres
Publié: (2026)
Efficient and Generalizable Environmental Understanding for Visual Navigation
par: Wang, Ruoyu, et autres
Publié: (2025)
par: Wang, Ruoyu, et autres
Publié: (2025)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
par: Huang, Jincai, et autres
Publié: (2026)
par: Huang, Jincai, et autres
Publié: (2026)
Learning Human-Humanoid Coordination for Collaborative Object Carrying
par: Du, Yushi, et autres
Publié: (2025)
par: Du, Yushi, et autres
Publié: (2025)
Dynamic Motion Blending for Versatile Motion Editing
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
par: Wang, Jingyi, et autres
Publié: (2024)
par: Wang, Jingyi, et autres
Publié: (2024)
R2G: Reasoning to Ground in 3D Scenes
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
OmniClone: Engineering a Robust, All-Rounder Whole-Body Humanoid Teleoperation System
par: Li, Yixuan, et autres
Publié: (2026)
par: Li, Yixuan, et autres
Publié: (2026)
Navigating Towards Fairness with Data Selection
par: Zhang, Yixuan, et autres
Publié: (2024)
par: Zhang, Yixuan, et autres
Publié: (2024)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
par: Lin, Sihao, et autres
Publié: (2025)
par: Lin, Sihao, et autres
Publié: (2025)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
par: Chu, Zedong, et autres
Publié: (2026)
par: Chu, Zedong, et autres
Publié: (2026)
Documents similaires
-
Task-oriented Sequential Grounding and Navigation in 3D Scenes
par: Zhang, Zhuofan, et autres
Publié: (2024) -
Unifying 3D Vision-Language Understanding via Promptable Queries
par: Zhu, Ziyu, et autres
Publié: (2024) -
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
par: Jia, Baoxiong, et autres
Publié: (2024) -
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2025) -
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
par: Wang, Yan, et autres
Publié: (2025)