Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Jiazhao, Wang, Kunyu, Wang, Shaoan, Li, Minghan, Liu, Haoran, Wei, Songlin, Wang, Zhongyuan, Zhang, Zhizheng, Wang, He |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
by: Zhang, Jiazhao, et al.
Published: (2024)
by: Zhang, Jiazhao, et al.
Published: (2024)
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
by: Liu, Jiahang, et al.
Published: (2026)
by: Liu, Jiahang, et al.
Published: (2026)
Embodied Navigation Foundation Model
by: Zhang, Jiazhao, et al.
Published: (2025)
by: Zhang, Jiazhao, et al.
Published: (2025)
TrackVLA: Embodied Visual Tracking in the Wild
by: Wang, Shaoan, et al.
Published: (2025)
by: Wang, Shaoan, et al.
Published: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
by: Li, Anqi, et al.
Published: (2025)
by: Li, Anqi, et al.
Published: (2025)
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
by: Liu, Jiahang, et al.
Published: (2026)
by: Liu, Jiahang, et al.
Published: (2026)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
by: Liu, Jiahang, et al.
Published: (2025)
by: Liu, Jiahang, et al.
Published: (2025)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
by: Ding, Hongyu, et al.
Published: (2026)
by: Ding, Hongyu, et al.
Published: (2026)
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
by: Xu, Tianyu, et al.
Published: (2025)
by: Xu, Tianyu, et al.
Published: (2025)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
by: Yang, Yi, et al.
Published: (2025)
by: Yang, Yi, et al.
Published: (2025)
LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion
by: Lyu, Jiangran, et al.
Published: (2026)
by: Lyu, Jiangran, et al.
Published: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
by: Zhang, Wenyao, et al.
Published: (2025)
by: Zhang, Wenyao, et al.
Published: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
by: Deng, Shengliang, et al.
Published: (2025)
by: Deng, Shengliang, et al.
Published: (2025)
NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks
by: Luo, Zhihao, et al.
Published: (2025)
by: Luo, Zhihao, et al.
Published: (2025)
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
by: Xie, Ziyang, et al.
Published: (2025)
by: Xie, Ziyang, et al.
Published: (2025)
Unified Vision-Language-Action Model
by: Wang, Yuqi, et al.
Published: (2025)
by: Wang, Yuqi, et al.
Published: (2025)
OctoNav: Towards Generalist Embodied Navigation
by: Gao, Chen, et al.
Published: (2025)
by: Gao, Chen, et al.
Published: (2025)
GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation
by: Cui, Wenbo, et al.
Published: (2024)
by: Cui, Wenbo, et al.
Published: (2024)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
by: Bai, Shuanghao, et al.
Published: (2026)
by: Bai, Shuanghao, et al.
Published: (2026)
Survey of Vision-Language-Action Models for Embodied Manipulation
by: Li, Haoran, et al.
Published: (2025)
by: Li, Haoran, et al.
Published: (2025)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
by: Zhang, Zhenhao, et al.
Published: (2026)
by: Zhang, Zhenhao, et al.
Published: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
Vision-Language Navigation with Embodied Intelligence: A Survey
by: Gao, Peng, et al.
Published: (2024)
by: Gao, Peng, et al.
Published: (2024)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
by: Zhang, Lingfeng, et al.
Published: (2025)
by: Zhang, Lingfeng, et al.
Published: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
by: Wang, Shaoan, et al.
Published: (2026)
by: Wang, Shaoan, et al.
Published: (2026)
ImagineNav: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination
by: Zhao, Xinxin, et al.
Published: (2024)
by: Zhao, Xinxin, et al.
Published: (2024)
ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination
by: Wang, Teng, et al.
Published: (2025)
by: Wang, Teng, et al.
Published: (2025)
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
by: Shou, Quanxin, et al.
Published: (2026)
by: Shou, Quanxin, et al.
Published: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
by: Li, Boyu, et al.
Published: (2026)
by: Li, Boyu, et al.
Published: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
by: Bai, Shuanghao, et al.
Published: (2026)
by: Bai, Shuanghao, et al.
Published: (2026)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
by: Yan, Yu, et al.
Published: (2024)
by: Yan, Yu, et al.
Published: (2024)
UniPlan: Vision-Language Task Planning for Mobile Manipulation with Unified PDDL Formulation
by: Ye, Haoming, et al.
Published: (2026)
by: Ye, Haoming, et al.
Published: (2026)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
by: Xu, Haiweng, et al.
Published: (2026)
by: Xu, Haiweng, et al.
Published: (2026)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
by: Wang, Qiuyue, et al.
Published: (2026)
by: Wang, Qiuyue, et al.
Published: (2026)
Embodied Navigation with Auxiliary Task of Action Description Prediction
by: Kondoh, Haru, et al.
Published: (2025)
by: Kondoh, Haru, et al.
Published: (2025)
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
by: Yu, En, et al.
Published: (2026)
by: Yu, En, et al.
Published: (2026)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
by: Govind, Manish Kumar, et al.
Published: (2026)
by: Govind, Manish Kumar, et al.
Published: (2026)
RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
by: Tai, Cong, et al.
Published: (2025)
by: Tai, Cong, et al.
Published: (2025)
Agentic Self-Evolutionary Replanning for Embodied Navigation
by: Li, Guoliang, et al.
Published: (2026)
by: Li, Guoliang, et al.
Published: (2026)
ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making
by: Dai, Liu, et al.
Published: (2025)
by: Dai, Liu, et al.
Published: (2025)
Similar Items
-
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
by: Zhang, Jiazhao, et al.
Published: (2024) -
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
by: Liu, Jiahang, et al.
Published: (2026) -
Embodied Navigation Foundation Model
by: Zhang, Jiazhao, et al.
Published: (2025) -
TrackVLA: Embodied Visual Tracking in the Wild
by: Wang, Shaoan, et al.
Published: (2025) -
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
by: Li, Anqi, et al.
Published: (2025)