ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866914324491010048 |
|---|---|
| author | Chu, Zedong Xie, Shichao Wu, Xiaolong Shen, Yanfen Luo, Minghua Wang, Zhengbo Liu, Fei Leng, Xiaoxu Hu, Junjun Yin, Mingyang Lu, Jia Guo, Yingnan Yang, Kai Han, Jiawei Chen, Xu Zhu, Yanqing Zhao, Yuxiang Liu, Xin Yang, Yirong He, Ye Wang, Jiahang Cai, Yang Zhang, Tianlin Gao, Li Liu, Liu Sun, Mingchao Jiang, Fan Wang, Chiyu Liu, Zhicheng Pan, Hongyu Han, Honglin Gu, Zhining Yang, Kuan Zhang, Jianfang Jing, Di Guan, Zihao Guo, Wei Liu, Guoqing Yang, Di Yang, Xiangpo Yang, Menglin Xing, Hongguang Li, Weiguo Xu, Mu |
| author_facet | Chu, Zedong Xie, Shichao Wu, Xiaolong Shen, Yanfen Luo, Minghua Wang, Zhengbo Liu, Fei Leng, Xiaoxu Hu, Junjun Yin, Mingyang Lu, Jia Guo, Yingnan Yang, Kai Han, Jiawei Chen, Xu Zhu, Yanqing Zhao, Yuxiang Liu, Xin Yang, Yirong He, Ye Wang, Jiahang Cai, Yang Zhang, Tianlin Gao, Li Liu, Liu Sun, Mingchao Jiang, Fan Wang, Chiyu Liu, Zhicheng Pan, Hongyu Han, Honglin Gu, Zhining Yang, Kuan Zhang, Jianfang Jing, Di Guan, Zihao Guo, Wei Liu, Guoqing Yang, Di Yang, Xiangpo Yang, Menglin Xing, Hongguang Li, Weiguo Xu, Mu |
| contents | Embodied navigation has long been fragmented by task-specific architectures. We introduce ABot-N0, a unified Vision-Language-Action (VLA) foundation model that achieves a ``Grand Unification'' across 5 core tasks: Point-Goal, Object-Goal, Instruction-Following, POI-Goal, and Person-Following. ABot-N0 utilizes a hierarchical ``Brain-Action'' architecture, pairing an LLM-based Cognitive Brain for semantic reasoning with a Flow Matching-based Action Expert for precise, continuous trajectory generation.
To support large-scale learning, we developed the ABot-N0 Data Engine, curating 16.9M expert trajectories and 5.0M reasoning samples across 7,802 high-fidelity 3D scenes (10.7 $\text{km}^2$). ABot-N0 achieves new SOTA performance across 7 benchmarks, significantly outperforming specialized models. Furthermore, our Agentic Navigation System integrates a planner with hierarchical topological memory, enabling robust, long-horizon missions in dynamic real-world environments. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2602_11598 |
| institution | arXiv |
| publishDate | 2026 |
| record_format | arxiv |
| spellingShingle | ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation Chu, Zedong Xie, Shichao Wu, Xiaolong Shen, Yanfen Luo, Minghua Wang, Zhengbo Liu, Fei Leng, Xiaoxu Hu, Junjun Yin, Mingyang Lu, Jia Guo, Yingnan Yang, Kai Han, Jiawei Chen, Xu Zhu, Yanqing Zhao, Yuxiang Liu, Xin Yang, Yirong He, Ye Wang, Jiahang Cai, Yang Zhang, Tianlin Gao, Li Liu, Liu Sun, Mingchao Jiang, Fan Wang, Chiyu Liu, Zhicheng Pan, Hongyu Han, Honglin Gu, Zhining Yang, Kuan Zhang, Jianfang Jing, Di Guan, Zihao Guo, Wei Liu, Guoqing Yang, Di Yang, Xiangpo Yang, Menglin Xing, Hongguang Li, Weiguo Xu, Mu Robotics Artificial Intelligence Computer Vision and Pattern Recognition Embodied navigation has long been fragmented by task-specific architectures. We introduce ABot-N0, a unified Vision-Language-Action (VLA) foundation model that achieves a ``Grand Unification'' across 5 core tasks: Point-Goal, Object-Goal, Instruction-Following, POI-Goal, and Person-Following. ABot-N0 utilizes a hierarchical ``Brain-Action'' architecture, pairing an LLM-based Cognitive Brain for semantic reasoning with a Flow Matching-based Action Expert for precise, continuous trajectory generation. To support large-scale learning, we developed the ABot-N0 Data Engine, curating 16.9M expert trajectories and 5.0M reasoning samples across 7,802 high-fidelity 3D scenes (10.7 $\text{km}^2$). ABot-N0 achieves new SOTA performance across 7 benchmarks, significantly outperforming specialized models. Furthermore, our Agentic Navigation System integrates a planner with hierarchical topological memory, enabling robust, long-horizon missions in dynamic real-world environments. |
| title | ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation |
| topic | Robotics Artificial Intelligence Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2602.11598 |