NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jiazhao, Wang, Kunyu, Xu, Rongtao, Zhou, Gengze, Hong, Yicong, Fang, Xiaomeng, Wu, Qi, Zhang, Zhizheng, Wang, He |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
di: Yan, Yu, et al.
Pubblicazione: (2024)
di: Yan, Yu, et al.
Pubblicazione: (2024)
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
Embodied Navigation Foundation Model
di: Zhang, Jiazhao, et al.
Pubblicazione: (2025)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
di: Li, Anqi, et al.
Pubblicazione: (2025)
di: Li, Anqi, et al.
Pubblicazione: (2025)
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
di: Xu, Tianyu, et al.
Pubblicazione: (2025)
di: Xu, Tianyu, et al.
Pubblicazione: (2025)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
di: Zhao, Xunyi, et al.
Pubblicazione: (2025)
di: Zhao, Xunyi, et al.
Pubblicazione: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
di: Li, Zerui, et al.
Pubblicazione: (2025)
di: Li, Zerui, et al.
Pubblicazione: (2025)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
di: Wang, Beichen, et al.
Pubblicazione: (2024)
di: Wang, Beichen, et al.
Pubblicazione: (2024)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory
di: Ji, Zihe, et al.
Pubblicazione: (2025)
di: Ji, Zihe, et al.
Pubblicazione: (2025)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
di: Liu, Jiaxing, et al.
Pubblicazione: (2026)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
di: Zhang, Zekai, et al.
Pubblicazione: (2025)
di: Zhang, Zekai, et al.
Pubblicazione: (2025)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
di: Chen, Kehan, et al.
Pubblicazione: (2024)
di: Chen, Kehan, et al.
Pubblicazione: (2024)
FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation
di: Chen, Kehan, et al.
Pubblicazione: (2026)
di: Chen, Kehan, et al.
Pubblicazione: (2026)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
di: He, Jiawei, et al.
Pubblicazione: (2025)
di: He, Jiawei, et al.
Pubblicazione: (2025)
AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation
di: Chen, Xuecheng, et al.
Pubblicazione: (2026)
di: Chen, Xuecheng, et al.
Pubblicazione: (2026)
GAMMA: Graspability-Aware Mobile MAnipulation Policy Learning based on Online Grasping Pose Fusion
di: Zhang, Jiazhao, et al.
Pubblicazione: (2023)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2023)
SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning
di: Han, Zebin, et al.
Pubblicazione: (2026)
di: Han, Zebin, et al.
Pubblicazione: (2026)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
di: Lin, Sihao, et al.
Pubblicazione: (2025)
di: Lin, Sihao, et al.
Pubblicazione: (2025)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
di: An, Dong, et al.
Pubblicazione: (2023)
di: An, Dong, et al.
Pubblicazione: (2023)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation
di: Wang, Xiangchen, et al.
Pubblicazione: (2026)
di: Wang, Xiangchen, et al.
Pubblicazione: (2026)
ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models
di: Lou, Zhichen, et al.
Pubblicazione: (2025)
di: Lou, Zhichen, et al.
Pubblicazione: (2025)
AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement
di: Hu, Zhaofeng, et al.
Pubblicazione: (2026)
di: Hu, Zhaofeng, et al.
Pubblicazione: (2026)
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
VLM-RRT: Vision Language Model Guided RRT Search for Autonomous UAV Navigation
di: Ye, Jianlin, et al.
Pubblicazione: (2025)
di: Ye, Jianlin, et al.
Pubblicazione: (2025)
VLM-Social-Nav: Socially Aware Robot Navigation through Scoring using Vision-Language Models
di: Song, Daeun, et al.
Pubblicazione: (2024)
di: Song, Daeun, et al.
Pubblicazione: (2024)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation
di: Schakkal, André, et al.
Pubblicazione: (2025)
di: Schakkal, André, et al.
Pubblicazione: (2025)
HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
di: Xu, Rongtao, et al.
Pubblicazione: (2026)
di: Xu, Rongtao, et al.
Pubblicazione: (2026)
STRIVE: Structured Representation Integrating VLM Reasoning for Efficient Object Navigation
di: Zhu, Haokun, et al.
Pubblicazione: (2025)
di: Zhu, Haokun, et al.
Pubblicazione: (2025)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
di: Peng, Cheng, et al.
Pubblicazione: (2025)
di: Peng, Cheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024) -
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024) -
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
di: Yan, Yu, et al.
Pubblicazione: (2024) -
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026) -
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026)