Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Lixuan, Dong, Haoyu, Chen, Zhenxing, Yu, Yangcheng, Feng, Jie, Li, Yong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation
von: Wu, Feng, et al.
Veröffentlicht: (2026)
von: Wu, Feng, et al.
Veröffentlicht: (2026)
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
von: Lyu, Kailin, et al.
Veröffentlicht: (2026)
von: Lyu, Kailin, et al.
Veröffentlicht: (2026)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
AMFT: Aligning LLM Reasoners by Meta-Learning the Optimal Imitation-Exploration Balance
von: He, Lixuan, et al.
Veröffentlicht: (2025)
von: He, Lixuan, et al.
Veröffentlicht: (2025)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
von: Long, Yuxing, et al.
Veröffentlicht: (2024)
von: Long, Yuxing, et al.
Veröffentlicht: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
von: Luo, Kun, et al.
Veröffentlicht: (2026)
von: Luo, Kun, et al.
Veröffentlicht: (2026)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
von: Ren, Xiyu, et al.
Veröffentlicht: (2026)
von: Ren, Xiyu, et al.
Veröffentlicht: (2026)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
von: Mei, Yanghong, et al.
Veröffentlicht: (2025)
von: Mei, Yanghong, et al.
Veröffentlicht: (2025)
TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents
von: Li, Kai, et al.
Veröffentlicht: (2026)
von: Li, Kai, et al.
Veröffentlicht: (2026)
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
von: Li, Yuyang, et al.
Veröffentlicht: (2026)
von: Li, Yuyang, et al.
Veröffentlicht: (2026)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
von: Zhan, Dijia, et al.
Veröffentlicht: (2026)
von: Zhan, Dijia, et al.
Veröffentlicht: (2026)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
von: Liu, Youzhi, et al.
Veröffentlicht: (2024)
von: Liu, Youzhi, et al.
Veröffentlicht: (2024)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
von: Yu, Zhuoyuan, et al.
Veröffentlicht: (2025)
von: Yu, Zhuoyuan, et al.
Veröffentlicht: (2025)
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
von: Wang, Bo, et al.
Veröffentlicht: (2025)
von: Wang, Bo, et al.
Veröffentlicht: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
von: Xu, Ming, et al.
Veröffentlicht: (2024)
von: Xu, Ming, et al.
Veröffentlicht: (2024)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
von: Jiang, Wen, et al.
Veröffentlicht: (2026)
von: Jiang, Wen, et al.
Veröffentlicht: (2026)
Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation
von: Zheng, Wanrong, et al.
Veröffentlicht: (2026)
von: Zheng, Wanrong, et al.
Veröffentlicht: (2026)
NavHint: Vision and Language Navigation Agent with a Hint Generator
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
RAISECity: A Multimodal Agent Framework for Reality-Aligned 3D World Generation at City-Scale
von: Wang, Shengyuan, et al.
Veröffentlicht: (2025)
von: Wang, Shengyuan, et al.
Veröffentlicht: (2025)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
von: Ma, Weitao, et al.
Veröffentlicht: (2026)
von: Ma, Weitao, et al.
Veröffentlicht: (2026)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
von: Wang, Yunheng, et al.
Veröffentlicht: (2025)
von: Wang, Yunheng, et al.
Veröffentlicht: (2025)
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
von: Wu, Di, et al.
Veröffentlicht: (2024)
von: Wu, Di, et al.
Veröffentlicht: (2024)
3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference
von: Köster, Joris, et al.
Veröffentlicht: (2026)
von: Köster, Joris, et al.
Veröffentlicht: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
von: Liu, Fei, et al.
Veröffentlicht: (2025)
von: Liu, Fei, et al.
Veröffentlicht: (2025)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
von: An, Dong, et al.
Veröffentlicht: (2023)
von: An, Dong, et al.
Veröffentlicht: (2023)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
von: Feng, Jie, et al.
Veröffentlicht: (2025)
von: Feng, Jie, et al.
Veröffentlicht: (2025)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions
von: Cai, Hengxing, et al.
Veröffentlicht: (2026)
von: Cai, Hengxing, et al.
Veröffentlicht: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
InfMem: Learning System-2 Memory Control for Long-Context Agent
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents
von: Li, Zihan, et al.
Veröffentlicht: (2026)
von: Li, Zihan, et al.
Veröffentlicht: (2026)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
von: Liang, Xiwen, et al.
Veröffentlicht: (2023)
von: Liang, Xiwen, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation
von: Wu, Feng, et al.
Veröffentlicht: (2026) -
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
von: Lyu, Kailin, et al.
Veröffentlicht: (2026) -
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2024) -
AMFT: Aligning LLM Reasoners by Meta-Learning the Optimal Imitation-Exploration Balance
von: He, Lixuan, et al.
Veröffentlicht: (2025) -
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
von: Long, Yuxing, et al.
Veröffentlicht: (2024)