MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Tianyu, Chen, Jiawei, Zhang, Jiazhao, Zhang, Wenyao, Qi, Zekun, Li, Minghan, Zhang, Zhizheng, Wang, He |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TrackVLA: Embodied Visual Tracking in the Wild
di: Wang, Shaoan, et al.
Pubblicazione: (2025)
di: Wang, Shaoan, et al.
Pubblicazione: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
di: Liu, Jiahang, et al.
Pubblicazione: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
di: Li, Anqi, et al.
Pubblicazione: (2025)
di: Li, Anqi, et al.
Pubblicazione: (2025)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
di: Peng, Baorui, et al.
Pubblicazione: (2026)
di: Peng, Baorui, et al.
Pubblicazione: (2026)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
di: Liu, Jiahang, et al.
Pubblicazione: (2026)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
di: He, Jiawei, et al.
Pubblicazione: (2025)
di: He, Jiawei, et al.
Pubblicazione: (2025)
OctoNav: Towards Generalist Embodied Navigation
di: Gao, Chen, et al.
Pubblicazione: (2025)
di: Gao, Chen, et al.
Pubblicazione: (2025)
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
di: Fan, Xianzhe, et al.
Pubblicazione: (2026)
di: Fan, Xianzhe, et al.
Pubblicazione: (2026)
Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
di: Zhang, Wenyao, et al.
Pubblicazione: (2026)
di: Zhang, Wenyao, et al.
Pubblicazione: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
di: Hu, Yue, et al.
Pubblicazione: (2026)
di: Hu, Yue, et al.
Pubblicazione: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
di: Liu, Youzhi, et al.
Pubblicazione: (2024)
di: Liu, Youzhi, et al.
Pubblicazione: (2024)
HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation
di: Yu, Zihui, et al.
Pubblicazione: (2026)
di: Yu, Zihui, et al.
Pubblicazione: (2026)
MemoNav: Working Memory Model for Visual Navigation
di: Li, Hongxin, et al.
Pubblicazione: (2024)
di: Li, Hongxin, et al.
Pubblicazione: (2024)
CogNav: Cognitive Process Modeling for Object Goal Navigation with LLMs
di: Cao, Yihan, et al.
Pubblicazione: (2024)
di: Cao, Yihan, et al.
Pubblicazione: (2024)
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
di: Qi, Zekun, et al.
Pubblicazione: (2025)
di: Qi, Zekun, et al.
Pubblicazione: (2025)
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments
di: Sun, Jian, et al.
Pubblicazione: (2026)
di: Sun, Jian, et al.
Pubblicazione: (2026)
Nav-R1: Reasoning and Navigation in Embodied Scenes
di: Liu, Qingxiang, et al.
Pubblicazione: (2025)
di: Liu, Qingxiang, et al.
Pubblicazione: (2025)
DynaNav: Dynamic Feature and Layer Selection for Efficient Visual Navigation
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation
di: Zhong, Linqing, et al.
Pubblicazione: (2024)
di: Zhong, Linqing, et al.
Pubblicazione: (2024)
NavQ: Learning a Q-Model for Foresighted Vision-and-Language Navigation
di: Xu, Peiran, et al.
Pubblicazione: (2025)
di: Xu, Peiran, et al.
Pubblicazione: (2025)
AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation
di: Deng, Yijie, et al.
Pubblicazione: (2026)
di: Deng, Yijie, et al.
Pubblicazione: (2026)
NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
di: Qiao, Yanyuan, et al.
Pubblicazione: (2024)
di: Qiao, Yanyuan, et al.
Pubblicazione: (2024)
PIG-Nav: Key Insights for Pretrained Image Goal Navigation Models
di: Wan, Jiansong, et al.
Pubblicazione: (2025)
di: Wan, Jiansong, et al.
Pubblicazione: (2025)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
di: Mei, Yanghong, et al.
Pubblicazione: (2025)
di: Mei, Yanghong, et al.
Pubblicazione: (2025)
YOPO-Nav: Visual Navigation using 3DGS Graphs from One-Pass Videos
di: Meegan, Ryan, et al.
Pubblicazione: (2025)
di: Meegan, Ryan, et al.
Pubblicazione: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
di: Wu, Pengying, et al.
Pubblicazione: (2024)
di: Wu, Pengying, et al.
Pubblicazione: (2024)
Deep Learning-Based Multi-Modal Fusion for Robust Robot Perception and Navigation
di: Lai, Delun, et al.
Pubblicazione: (2025)
di: Lai, Delun, et al.
Pubblicazione: (2025)
MM-Gaussian: 3D Gaussian-based Multi-modal Fusion for Localization and Reconstruction in Unbounded Scenes
di: Wu, Chenyang, et al.
Pubblicazione: (2024)
di: Wu, Chenyang, et al.
Pubblicazione: (2024)
RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
di: Wang, Boyang, et al.
Pubblicazione: (2026)
di: Wang, Boyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TrackVLA: Embodied Visual Tracking in the Wild
di: Wang, Shaoan, et al.
Pubblicazione: (2025) -
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
di: Zhang, Wenyao, et al.
Pubblicazione: (2025) -
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
di: Liu, Jiahang, et al.
Pubblicazione: (2025) -
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
di: Li, Anqi, et al.
Pubblicazione: (2025) -
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
di: Peng, Baorui, et al.
Pubblicazione: (2026)