SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Zebin, Wang, Xudong, Liu, Baichen, Lyu, Qi, Shang, Zhenduo, Dong, Jiahua, Liu, Lianqing, Han, Zhi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lifelong Embodied Navigation Learning
par: Wang, Xudong, et autres
Publié: (2026)
par: Wang, Xudong, et autres
Publié: (2026)
Lifelong Language-Conditioned Robotic Manipulation Learning
par: Wang, Xudong, et autres
Publié: (2026)
par: Wang, Xudong, et autres
Publié: (2026)
CRISP: Contrastive Residual Injection and Semantic Prompting for Continual Video Instance Segmentation
par: Liu, Baichen, et autres
Publié: (2025)
par: Liu, Baichen, et autres
Publié: (2025)
All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation
par: Wang, Xudong, et autres
Publié: (2026)
par: Wang, Xudong, et autres
Publié: (2026)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
par: Feng, Yunhai, et autres
Publié: (2025)
par: Feng, Yunhai, et autres
Publié: (2025)
Vision-Language Navigation with Continual Learning
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
par: Gao, Yunpeng, et autres
Publié: (2024)
par: Gao, Yunpeng, et autres
Publié: (2024)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
par: Dalal, Murtaza, et autres
Publié: (2024)
par: Dalal, Murtaza, et autres
Publié: (2024)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
par: Yang, Ran, et autres
Publié: (2025)
par: Yang, Ran, et autres
Publié: (2025)
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation
par: Fan, Chengjie, et autres
Publié: (2026)
par: Fan, Chengjie, et autres
Publié: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
SayNav: Grounding Large Language Models for Dynamic Planning to Navigation in New Environments
par: Rajvanshi, Abhinav, et autres
Publié: (2023)
par: Rajvanshi, Abhinav, et autres
Publié: (2023)
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
par: Liu, Xu, et autres
Publié: (2025)
par: Liu, Xu, et autres
Publié: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval
par: Yang, Zebin, et autres
Publié: (2025)
par: Yang, Zebin, et autres
Publié: (2025)
Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System
par: Liu, Haokun, et autres
Publié: (2025)
par: Liu, Haokun, et autres
Publié: (2025)
Human-Aware Vision-and-Language Navigation: Bridging Simulation to Reality with Dynamic Human Interactions
par: Li, Heng, et autres
Publié: (2024)
par: Li, Heng, et autres
Publié: (2024)
VORL-EXPLORE: A Hybrid Learning Planning Approach to Multi-Robot Exploration in Dynamic Environments
par: Liu, Ning, et autres
Publié: (2026)
par: Liu, Ning, et autres
Publié: (2026)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
par: Wu, Yuze, et autres
Publié: (2025)
par: Wu, Yuze, et autres
Publié: (2025)
AINav: Large Language Model-Based Adaptive Interactive Navigation
par: Zhou, Kangjie, et autres
Publié: (2025)
par: Zhou, Kangjie, et autres
Publié: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
par: Wen, Congcong, et autres
Publié: (2024)
par: Wen, Congcong, et autres
Publié: (2024)
Interactive Navigation in Environments with Traversable Obstacles Using Large Language and Vision-Language Models
par: Zhang, Zhen, et autres
Publié: (2023)
par: Zhang, Zhen, et autres
Publié: (2023)
VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation
par: Castro, Mateo Guaman, et autres
Publié: (2025)
par: Castro, Mateo Guaman, et autres
Publié: (2025)
Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile Manipulation
par: Wang, Fangyuan, et autres
Publié: (2025)
par: Wang, Fangyuan, et autres
Publié: (2025)
FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation
par: Chen, Kehan, et autres
Publié: (2026)
par: Chen, Kehan, et autres
Publié: (2026)
Spatially Grounded Long-Horizon Task Planning in the Wild
par: Jung, Sehun, et autres
Publié: (2026)
par: Jung, Sehun, et autres
Publié: (2026)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
par: Liu, Jinkun, et autres
Publié: (2026)
par: Liu, Jinkun, et autres
Publié: (2026)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
Decomposition-based Hierarchical Task Allocation and Planning for Multi-Robots under Hierarchical Temporal Logic Specifications
par: Luo, Xusheng, et autres
Publié: (2023)
par: Luo, Xusheng, et autres
Publié: (2023)
Active Test-time Vision-Language Navigation
par: Ko, Heeju, et autres
Publié: (2025)
par: Ko, Heeju, et autres
Publié: (2025)
ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents
par: Guo, Shuhan, et autres
Publié: (2026)
par: Guo, Shuhan, et autres
Publié: (2026)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
par: Hao, Haihong, et autres
Publié: (2026)
par: Hao, Haihong, et autres
Publié: (2026)
Language-Conditioned World Modeling for Visual Navigation
par: Dong, Yifei, et autres
Publié: (2026)
par: Dong, Yifei, et autres
Publié: (2026)
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
BadNAVer: Exploring Jailbreak Attacks On Vision-and-Language Navigation
par: Lyu, Wenqi, et autres
Publié: (2025)
par: Lyu, Wenqi, et autres
Publié: (2025)
Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
par: Malik, Ashish, et autres
Publié: (2026)
par: Malik, Ashish, et autres
Publié: (2026)
AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models
par: Han, Yuxuan, et autres
Publié: (2026)
par: Han, Yuxuan, et autres
Publié: (2026)
Documents similaires
-
Lifelong Embodied Navigation Learning
par: Wang, Xudong, et autres
Publié: (2026) -
Lifelong Language-Conditioned Robotic Manipulation Learning
par: Wang, Xudong, et autres
Publié: (2026) -
CRISP: Contrastive Residual Injection and Semantic Prompting for Continual Video Instance Segmentation
par: Liu, Baichen, et autres
Publié: (2025) -
All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation
par: Wang, Xudong, et autres
Publié: (2026) -
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
par: Zhang, Weichen, et autres
Publié: (2025)