ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Chu, Zedong, Xie, Shichao, Wu, Xiaolong, Shen, Yanfen, Luo, Minghua, Wang, Zhengbo, Liu, Fei, Leng, Xiaoxu, Hu, Junjun, Yin, Mingyang, Lu, Jia, Guo, Yingnan, Yang, Kai, Han, Jiawei, Chen, Xu, Zhu, Yanqing, Zhao, Yuxiang, Liu, Xin, Yang, Yirong, He, Ye, Wang, Jiahang, Cai, Yang, Zhang, Tianlin, Gao, Li, Liu, Liu, Sun, Mingchao, Jiang, Fan, Wang, Chiyu, Liu, Zhicheng, Pan, Hongyu, Han, Honglin, Gu, Zhining, Yang, Kuan, Zhang, Jianfang, Jing, Di, Guan, Zihao, Guo, Wei, Liu, Guoqing, Yang, Di, Yang, Xiangpo, Yang, Menglin, Xing, Hongguang, Li, Weiguo, Xu, Mu
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866914324491010048
author Chu, Zedong
Xie, Shichao
Wu, Xiaolong
Shen, Yanfen
Luo, Minghua
Wang, Zhengbo
Liu, Fei
Leng, Xiaoxu
Hu, Junjun
Yin, Mingyang
Lu, Jia
Guo, Yingnan
Yang, Kai
Han, Jiawei
Chen, Xu
Zhu, Yanqing
Zhao, Yuxiang
Liu, Xin
Yang, Yirong
He, Ye
Wang, Jiahang
Cai, Yang
Zhang, Tianlin
Gao, Li
Liu, Liu
Sun, Mingchao
Jiang, Fan
Wang, Chiyu
Liu, Zhicheng
Pan, Hongyu
Han, Honglin
Gu, Zhining
Yang, Kuan
Zhang, Jianfang
Jing, Di
Guan, Zihao
Guo, Wei
Liu, Guoqing
Yang, Di
Yang, Xiangpo
Yang, Menglin
Xing, Hongguang
Li, Weiguo
Xu, Mu
author_facet Chu, Zedong
Xie, Shichao
Wu, Xiaolong
Shen, Yanfen
Luo, Minghua
Wang, Zhengbo
Liu, Fei
Leng, Xiaoxu
Hu, Junjun
Yin, Mingyang
Lu, Jia
Guo, Yingnan
Yang, Kai
Han, Jiawei
Chen, Xu
Zhu, Yanqing
Zhao, Yuxiang
Liu, Xin
Yang, Yirong
He, Ye
Wang, Jiahang
Cai, Yang
Zhang, Tianlin
Gao, Li
Liu, Liu
Sun, Mingchao
Jiang, Fan
Wang, Chiyu
Liu, Zhicheng
Pan, Hongyu
Han, Honglin
Gu, Zhining
Yang, Kuan
Zhang, Jianfang
Jing, Di
Guan, Zihao
Guo, Wei
Liu, Guoqing
Yang, Di
Yang, Xiangpo
Yang, Menglin
Xing, Hongguang
Li, Weiguo
Xu, Mu
contents Embodied navigation has long been fragmented by task-specific architectures. We introduce ABot-N0, a unified Vision-Language-Action (VLA) foundation model that achieves a ``Grand Unification'' across 5 core tasks: Point-Goal, Object-Goal, Instruction-Following, POI-Goal, and Person-Following. ABot-N0 utilizes a hierarchical ``Brain-Action'' architecture, pairing an LLM-based Cognitive Brain for semantic reasoning with a Flow Matching-based Action Expert for precise, continuous trajectory generation. To support large-scale learning, we developed the ABot-N0 Data Engine, curating 16.9M expert trajectories and 5.0M reasoning samples across 7,802 high-fidelity 3D scenes (10.7 $\text{km}^2$). ABot-N0 achieves new SOTA performance across 7 benchmarks, significantly outperforming specialized models. Furthermore, our Agentic Navigation System integrates a planner with hierarchical topological memory, enabling robust, long-horizon missions in dynamic real-world environments.
format Preprint
id arxiv_https___arxiv_org_abs_2602_11598
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
Chu, Zedong
Xie, Shichao
Wu, Xiaolong
Shen, Yanfen
Luo, Minghua
Wang, Zhengbo
Liu, Fei
Leng, Xiaoxu
Hu, Junjun
Yin, Mingyang
Lu, Jia
Guo, Yingnan
Yang, Kai
Han, Jiawei
Chen, Xu
Zhu, Yanqing
Zhao, Yuxiang
Liu, Xin
Yang, Yirong
He, Ye
Wang, Jiahang
Cai, Yang
Zhang, Tianlin
Gao, Li
Liu, Liu
Sun, Mingchao
Jiang, Fan
Wang, Chiyu
Liu, Zhicheng
Pan, Hongyu
Han, Honglin
Gu, Zhining
Yang, Kuan
Zhang, Jianfang
Jing, Di
Guan, Zihao
Guo, Wei
Liu, Guoqing
Yang, Di
Yang, Xiangpo
Yang, Menglin
Xing, Hongguang
Li, Weiguo
Xu, Mu
Robotics
Artificial Intelligence
Computer Vision and Pattern Recognition
Embodied navigation has long been fragmented by task-specific architectures. We introduce ABot-N0, a unified Vision-Language-Action (VLA) foundation model that achieves a ``Grand Unification'' across 5 core tasks: Point-Goal, Object-Goal, Instruction-Following, POI-Goal, and Person-Following. ABot-N0 utilizes a hierarchical ``Brain-Action'' architecture, pairing an LLM-based Cognitive Brain for semantic reasoning with a Flow Matching-based Action Expert for precise, continuous trajectory generation. To support large-scale learning, we developed the ABot-N0 Data Engine, curating 16.9M expert trajectories and 5.0M reasoning samples across 7,802 high-fidelity 3D scenes (10.7 $\text{km}^2$). ABot-N0 achieves new SOTA performance across 7 benchmarks, significantly outperforming specialized models. Furthermore, our Agentic Navigation System integrates a planner with hierarchical topological memory, enabling robust, long-horizon missions in dynamic real-world environments.
title ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
topic Robotics
Artificial Intelligence
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2602.11598