CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Weichen, Gao, Chen, Yu, Shiquan, Peng, Ruiying, Zhao, Baining, Zhang, Qian, Cui, Jinqiang, Chen, Xinlei, Li, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024)
by: Gao, Chen, et al.
Published: (2024)
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
by: Zhao, Baining, et al.
Published: (2025)
by: Zhao, Baining, et al.
Published: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
by: Zhao, Baining, et al.
Published: (2026)
by: Zhao, Baining, et al.
Published: (2026)
Understanding and Evaluating Hallucinations in 3D Visual Language Models
by: Peng, Ruiying, et al.
Published: (2025)
by: Peng, Ruiying, et al.
Published: (2025)
AirScape: An Aerial Generative World Model with Motion Controllability
by: Zhao, Baining, et al.
Published: (2025)
by: Zhao, Baining, et al.
Published: (2025)
ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning
by: Liu, Xuchen, et al.
Published: (2026)
by: Liu, Xuchen, et al.
Published: (2026)
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
by: Zhao, Baining, et al.
Published: (2026)
by: Zhao, Baining, et al.
Published: (2026)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
by: Zhang, Lingfeng, et al.
Published: (2025)
by: Zhang, Lingfeng, et al.
Published: (2025)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
by: Lee, Jungdae, et al.
Published: (2024)
by: Lee, Jungdae, et al.
Published: (2024)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
by: Zhao, Baining, et al.
Published: (2025)
by: Zhao, Baining, et al.
Published: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
by: Zhan, Dijia, et al.
Published: (2026)
by: Zhan, Dijia, et al.
Published: (2026)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
by: He, Lixuan, et al.
Published: (2025)
by: He, Lixuan, et al.
Published: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
NavHint: Vision and Language Navigation Agent with a Hint Generator
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph
by: Niu, Haochen, et al.
Published: (2026)
by: Niu, Haochen, et al.
Published: (2026)
OctoNav: Towards Generalist Embodied Navigation
by: Gao, Chen, et al.
Published: (2025)
by: Gao, Chen, et al.
Published: (2025)
osmAG-Nav: A Hierarchical Semantic Topometric Navigation Stack for Robust Lifelong Indoor Autonomy
by: Zhang, Yongqi, et al.
Published: (2026)
by: Zhang, Yongqi, et al.
Published: (2026)
P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation
by: Li, Tianfu, et al.
Published: (2026)
by: Li, Tianfu, et al.
Published: (2026)
Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation
by: Zheng, Wanrong, et al.
Published: (2026)
by: Zheng, Wanrong, et al.
Published: (2026)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
by: Liang, Xiwen, et al.
Published: (2023)
by: Liang, Xiwen, et al.
Published: (2023)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
by: Liu, Fei, et al.
Published: (2025)
by: Liu, Fei, et al.
Published: (2025)
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
by: Fang, Jianjie, et al.
Published: (2026)
by: Fang, Jianjie, et al.
Published: (2026)
MemoNav: Working Memory Model for Visual Navigation
by: Li, Hongxin, et al.
Published: (2024)
by: Li, Hongxin, et al.
Published: (2024)
AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation
by: Chen, Xuecheng, et al.
Published: (2026)
by: Chen, Xuecheng, et al.
Published: (2026)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
by: Wang, Shaoan, et al.
Published: (2026)
by: Wang, Shaoan, et al.
Published: (2026)
LOG-Nav: Efficient Layout-Aware Object-Goal Navigation with Hierarchical Planning
by: Hou, Jiawei, et al.
Published: (2025)
by: Hou, Jiawei, et al.
Published: (2025)
HE-Nav: A High-Performance and Efficient Navigation System for Aerial-Ground Robots in Cluttered Environments
by: Wang, Junming, et al.
Published: (2024)
by: Wang, Junming, et al.
Published: (2024)
HG3-NeRF: Hierarchical Geometric, Semantic, and Photometric Guided Neural Radiance Fields for Sparse View Inputs
by: Gao, Zelin, et al.
Published: (2024)
by: Gao, Zelin, et al.
Published: (2024)
WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
by: Chen, Hongjin, et al.
Published: (2026)
by: Chen, Hongjin, et al.
Published: (2026)
Aerial Lifting: Neural Urban Semantic and Building Instance Lifting from Aerial Imagery
by: Zhang, Yuqi, et al.
Published: (2024)
by: Zhang, Yuqi, et al.
Published: (2024)
Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System
by: Liu, Haokun, et al.
Published: (2025)
by: Liu, Haokun, et al.
Published: (2025)
Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial‐Ground Robotic System
by: Haokun Liu, et al.
Published: (2025)
by: Haokun Liu, et al.
Published: (2025)
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
by: Liu, Jiahang, et al.
Published: (2026)
by: Liu, Jiahang, et al.
Published: (2026)
AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation
by: Ding, Xin, et al.
Published: (2025)
by: Ding, Xin, et al.
Published: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
by: Yue, Junrong, et al.
Published: (2025)
by: Yue, Junrong, et al.
Published: (2025)
Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing Agents
by: Man, Fanhang, et al.
Published: (2025)
by: Man, Fanhang, et al.
Published: (2025)
RA-Nav: A Risk-Aware Navigation System Based on Semantic Segmentation for Aerial Robots in Unpredictable Environments
by: Zong, Ziyi, et al.
Published: (2026)
by: Zong, Ziyi, et al.
Published: (2026)
Aerial Shepherds: Enabling Hierarchical Localization in Heterogeneous MAV Swarms
by: Wang, Haoyang, et al.
Published: (2025)
by: Wang, Haoyang, et al.
Published: (2025)
Similar Items
-
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
by: Gao, Chen, et al.
Published: (2024) -
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
by: Zhang, Weichen, et al.
Published: (2025) -
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
by: Zhao, Baining, et al.
Published: (2025) -
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
by: Zhao, Baining, et al.
Published: (2026) -
Understanding and Evaluating Hallucinations in 3D Visual Language Models
by: Peng, Ruiying, et al.
Published: (2025)