CMMR-VLN: Vision-and-Language Navigation via Continual Multimodal Memory Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haozhou, Dong, Xiangyu, Jiang, Huiyan, Zhou, Yaoming, Ma, Xiaoguang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
par: Dong, Xiangyu, et autres
Publié: (2025)
par: Dong, Xiangyu, et autres
Publié: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
par: Tong, Haoyu, et autres
Publié: (2026)
par: Tong, Haoyu, et autres
Publié: (2026)
PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings
par: Gao, Jiang, et autres
Publié: (2026)
par: Gao, Jiang, et autres
Publié: (2026)
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
par: Luo, Kun, et autres
Publié: (2026)
par: Luo, Kun, et autres
Publié: (2026)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation
par: Dai, Guangzhao, et autres
Publié: (2024)
par: Dai, Guangzhao, et autres
Publié: (2024)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
par: Yang, Jiahao, et autres
Publié: (2026)
par: Yang, Jiahao, et autres
Publié: (2026)
SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments
par: Li, Tianshun, et autres
Publié: (2025)
par: Li, Tianshun, et autres
Publié: (2025)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
par: Zhang, Zekai, et autres
Publié: (2025)
par: Zhang, Zekai, et autres
Publié: (2025)
Vision-Language Navigation with Continual Learning
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions
par: Dong, Yifei, et autres
Publié: (2025)
par: Dong, Yifei, et autres
Publié: (2025)
Mean-Flow based One-Step Vision-Language-Action
par: Chen, Yang, et autres
Publié: (2026)
par: Chen, Yang, et autres
Publié: (2026)
Continual Vision-and-Language Navigation
par: Jeong, Seongjun, et autres
Publié: (2024)
par: Jeong, Seongjun, et autres
Publié: (2024)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
Towards General Continuous Memory for Vision-Language Models
par: Wu, Wenyi, et autres
Publié: (2025)
par: Wu, Wenyi, et autres
Publié: (2025)
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
par: Xu, Yunzhe, et autres
Publié: (2025)
par: Xu, Yunzhe, et autres
Publié: (2025)
User-Feedback-Driven Adaptation for Vision-and-Language Navigation
par: Yu, Yongqiang, et autres
Publié: (2025)
par: Yu, Yongqiang, et autres
Publié: (2025)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
par: Gu, Shutian, et autres
Publié: (2026)
par: Gu, Shutian, et autres
Publié: (2026)
TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues
par: Zeng, Tianle, et autres
Publié: (2026)
par: Zeng, Tianle, et autres
Publié: (2026)
VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation
par: Bhatt, Neel P., et autres
Publié: (2025)
par: Bhatt, Neel P., et autres
Publié: (2025)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
par: Zhou, Jiawei, et autres
Publié: (2022)
par: Zhou, Jiawei, et autres
Publié: (2022)
Interactive Navigation in Environments with Traversable Obstacles Using Large Language and Vision-Language Models
par: Zhang, Zhen, et autres
Publié: (2023)
par: Zhang, Zhen, et autres
Publié: (2023)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults
par: Wang, Jinzhi, et autres
Publié: (2024)
par: Wang, Jinzhi, et autres
Publié: (2024)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Key-Value Pair-Free Continual Learner via Task-Specific Prompt-Prototype
par: Luo, Haihua, et autres
Publié: (2026)
par: Luo, Haihua, et autres
Publié: (2026)
Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
par: Liu, Xu, et autres
Publié: (2025)
par: Liu, Xu, et autres
Publié: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
CoFL: Continuous Flow Fields for Language-Conditioned Navigation
par: Liu, Haokun, et autres
Publié: (2026)
par: Liu, Haokun, et autres
Publié: (2026)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Hierarchical Memory Organization for Wikipedia Generation
par: Yu, Eugene J., et autres
Publié: (2025)
par: Yu, Eugene J., et autres
Publié: (2025)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
Vision-and-Language Navigation via Causal Learning
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model
par: Huang, Changxin, et autres
Publié: (2025)
par: Huang, Changxin, et autres
Publié: (2025)
DIM: Dynamic Integration of Multimodal Entity Linking with Large Language Model
par: Song, Shezheng, et autres
Publié: (2024)
par: Song, Shezheng, et autres
Publié: (2024)
Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
par: Jo, Yujin, et autres
Publié: (2025)
par: Jo, Yujin, et autres
Publié: (2025)
Documents similaires
-
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
par: Dong, Xiangyu, et autres
Publié: (2025) -
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
par: Tong, Haoyu, et autres
Publié: (2026) -
PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings
par: Gao, Jiang, et autres
Publié: (2026) -
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
par: Luo, Kun, et autres
Publié: (2026) -
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
par: Zhao, Xiaobei, et autres
Publié: (2025)