Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Yunpeng, Wang, Zhigang, Han, Pengfei, Jing, Linglin, Wang, Dong, Zhao, Bin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
by: Qu, Delin, et al.
Published: (2025)
by: Qu, Delin, et al.
Published: (2025)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
by: Wu, Yuze, et al.
Published: (2025)
by: Wu, Yuze, et al.
Published: (2025)
Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation
by: Bai, Qianqian, et al.
Published: (2025)
by: Bai, Qianqian, et al.
Published: (2025)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
by: Fan, Chengjie, et al.
Published: (2026)
by: Fan, Chengjie, et al.
Published: (2026)
SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning
by: Han, Zebin, et al.
Published: (2026)
by: Han, Zebin, et al.
Published: (2026)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
by: Zhao, Xiaobei, et al.
Published: (2025)
by: Zhao, Xiaobei, et al.
Published: (2025)
COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models
by: Liu, Kehui, et al.
Published: (2024)
by: Liu, Kehui, et al.
Published: (2024)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
by: Zhang, Pingrui, et al.
Published: (2025)
by: Zhang, Pingrui, et al.
Published: (2025)
ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation
by: Elnoor, Mohamed, et al.
Published: (2025)
by: Elnoor, Mohamed, et al.
Published: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
by: Wen, Congcong, et al.
Published: (2024)
by: Wen, Congcong, et al.
Published: (2024)
Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System
by: Liu, Haokun, et al.
Published: (2025)
by: Liu, Haokun, et al.
Published: (2025)
3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting
by: Zheng, Wancai, et al.
Published: (2026)
by: Zheng, Wancai, et al.
Published: (2026)
Vision-Language Navigation with Embodied Intelligence: A Survey
by: Gao, Peng, et al.
Published: (2024)
by: Gao, Peng, et al.
Published: (2024)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
by: Tong, Haoyu, et al.
Published: (2026)
by: Tong, Haoyu, et al.
Published: (2026)
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
by: Wang, Taowen, et al.
Published: (2024)
by: Wang, Taowen, et al.
Published: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
by: Zhang, Jiwen, et al.
Published: (2026)
by: Zhang, Jiwen, et al.
Published: (2026)
Vision-Language Navigation with Continual Learning
by: Li, Zhiyuan, et al.
Published: (2024)
by: Li, Zhiyuan, et al.
Published: (2024)
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
by: Zhang, Pingrui, et al.
Published: (2025)
by: Zhang, Pingrui, et al.
Published: (2025)
KOI: Accelerating Online Imitation Learning via Hybrid Key-state Guidance
by: Lu, Jingxian, et al.
Published: (2024)
by: Lu, Jingxian, et al.
Published: (2024)
Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs
by: Xia, Wenke, et al.
Published: (2023)
by: Xia, Wenke, et al.
Published: (2023)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
by: Zhou, Enshen, et al.
Published: (2025)
by: Zhou, Enshen, et al.
Published: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
by: Hao, Haihong, et al.
Published: (2026)
by: Hao, Haihong, et al.
Published: (2026)
AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation
by: Chen, Xuecheng, et al.
Published: (2026)
by: Chen, Xuecheng, et al.
Published: (2026)
Active Test-time Vision-Language Navigation
by: Ko, Heeju, et al.
Published: (2025)
by: Ko, Heeju, et al.
Published: (2025)
GarmentPile++: Affordance-Driven Cluttered Garments Retrieval with Vision-Language Reasoning
by: Li, Mingleyang, et al.
Published: (2026)
by: Li, Mingleyang, et al.
Published: (2026)
Trajectory Conditioned Cross-embodiment Skill Transfer
by: Tang, YuHang, et al.
Published: (2025)
by: Tang, YuHang, et al.
Published: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
Fly0: Decoupling Semantic Grounding from Geometric Planning for Zero-Shot Aerial Navigation
by: Xu, Zhenxing, et al.
Published: (2026)
by: Xu, Zhenxing, et al.
Published: (2026)
Mean-Flow based One-Step Vision-Language-Action
by: Chen, Yang, et al.
Published: (2026)
by: Chen, Yang, et al.
Published: (2026)
Lifelong Embodied Navigation Learning
by: Wang, Xudong, et al.
Published: (2026)
by: Wang, Xudong, et al.
Published: (2026)
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
by: Dong, Perry, et al.
Published: (2026)
by: Dong, Perry, et al.
Published: (2026)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
by: Pan, Xu, et al.
Published: (2026)
by: Pan, Xu, et al.
Published: (2026)
LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
by: Liu, Yudong, et al.
Published: (2025)
by: Liu, Yudong, et al.
Published: (2025)
General-Purpose Aerial Intelligent Agents Empowered by Large Language Models
by: Zhao, Ji, et al.
Published: (2025)
by: Zhao, Ji, et al.
Published: (2025)
LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning
by: Wang, Shu, et al.
Published: (2024)
by: Wang, Shu, et al.
Published: (2024)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
by: Yin, Cheng, et al.
Published: (2025)
by: Yin, Cheng, et al.
Published: (2025)
Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
by: Li, Shunlei, et al.
Published: (2025)
by: Li, Shunlei, et al.
Published: (2025)
Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving
by: Hu, Haibo, et al.
Published: (2025)
by: Hu, Haibo, et al.
Published: (2025)
Similar Items
-
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
by: Qu, Delin, et al.
Published: (2025) -
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
by: Wu, Yuze, et al.
Published: (2025) -
Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation
by: Bai, Qianqian, et al.
Published: (2025) -
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
by: Zhang, Weichen, et al.
Published: (2025) -
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
by: Fan, Chengjie, et al.
Published: (2026)