Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Duo, Huang, Shijia, Li, Yanyang, Wang, Liwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
von: Zheng, Duo, et al.
Veröffentlicht: (2025)
von: Zheng, Duo, et al.
Veröffentlicht: (2025)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
von: Zheng, Duo, et al.
Veröffentlicht: (2024)
von: Zheng, Duo, et al.
Veröffentlicht: (2024)
Towards Learning a Generalist Model for Embodied Navigation
von: Zheng, Duo, et al.
Veröffentlicht: (2023)
von: Zheng, Duo, et al.
Veröffentlicht: (2023)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
von: Yang, Jiahao, et al.
Veröffentlicht: (2026)
von: Yang, Jiahao, et al.
Veröffentlicht: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
von: Zhao, Baining, et al.
Veröffentlicht: (2026)
von: Zhao, Baining, et al.
Veröffentlicht: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
von: Yin, Hang, et al.
Veröffentlicht: (2025)
von: Yin, Hang, et al.
Veröffentlicht: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
von: Wei, Meng, et al.
Veröffentlicht: (2025)
von: Wei, Meng, et al.
Veröffentlicht: (2025)
UAV-VLN: End-to-End Vision Language guided Navigation for UAVs
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation
von: Dai, Guangzhao, et al.
Veröffentlicht: (2024)
von: Dai, Guangzhao, et al.
Veröffentlicht: (2024)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
von: Li, Jialu, et al.
Veröffentlicht: (2024)
von: Li, Jialu, et al.
Veröffentlicht: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
von: Hu, Zi-Yuan, et al.
Veröffentlicht: (2025)
von: Hu, Zi-Yuan, et al.
Veröffentlicht: (2025)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
von: Zuo, Jing, et al.
Veröffentlicht: (2026)
von: Zuo, Jing, et al.
Veröffentlicht: (2026)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
von: Zeng, Shuang, et al.
Veröffentlicht: (2025)
von: Zeng, Shuang, et al.
Veröffentlicht: (2025)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
von: Zhang, Zekai, et al.
Veröffentlicht: (2025)
von: Zhang, Zekai, et al.
Veröffentlicht: (2025)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
von: Dong, Xiangyu, et al.
Veröffentlicht: (2025)
von: Dong, Xiangyu, et al.
Veröffentlicht: (2025)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
von: Gu, Shutian, et al.
Veröffentlicht: (2026)
von: Gu, Shutian, et al.
Veröffentlicht: (2026)
Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration
von: Yue, Lu, et al.
Veröffentlicht: (2026)
von: Yue, Lu, et al.
Veröffentlicht: (2026)
World-Consistent Data Generation for Vision-and-Language Navigation
von: Zhong, Yu, et al.
Veröffentlicht: (2024)
von: Zhong, Yu, et al.
Veröffentlicht: (2024)
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
von: Lyu, Kailin, et al.
Veröffentlicht: (2026)
von: Lyu, Kailin, et al.
Veröffentlicht: (2026)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
von: Zhao, Xunyi, et al.
Veröffentlicht: (2025)
von: Zhao, Xunyi, et al.
Veröffentlicht: (2025)
Harnessing Input-Adaptive Inference for Efficient VLN
von: Kang, Dongwoo, et al.
Veröffentlicht: (2025)
von: Kang, Dongwoo, et al.
Veröffentlicht: (2025)
VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator
von: Dominguez-Dager, Bessie, et al.
Veröffentlicht: (2026)
von: Dominguez-Dager, Bessie, et al.
Veröffentlicht: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans
von: Loh, Dillon, et al.
Veröffentlicht: (2024)
von: Loh, Dillon, et al.
Veröffentlicht: (2024)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
von: Peng, Daojie, et al.
Veröffentlicht: (2026)
von: Peng, Daojie, et al.
Veröffentlicht: (2026)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
von: Huang, Bowen, et al.
Veröffentlicht: (2024)
von: Huang, Bowen, et al.
Veröffentlicht: (2024)
Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
von: Li, Xueying, et al.
Veröffentlicht: (2026)
von: Li, Xueying, et al.
Veröffentlicht: (2026)
SVFormer: A Direct Training Spiking Transformer for Efficient Video Action Recognition
von: Yu, Liutao, et al.
Veröffentlicht: (2024)
von: Yu, Liutao, et al.
Veröffentlicht: (2024)
A Survey on Efficient Vision-Language Models
von: Shinde, Gaurav, et al.
Veröffentlicht: (2025)
von: Shinde, Gaurav, et al.
Veröffentlicht: (2025)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
von: Li, Yingyue, et al.
Veröffentlicht: (2025)
von: Li, Yingyue, et al.
Veröffentlicht: (2025)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
von: Lim, Gyubeum, et al.
Veröffentlicht: (2025)
von: Lim, Gyubeum, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
von: Zheng, Duo, et al.
Veröffentlicht: (2025) -
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
von: Zheng, Duo, et al.
Veröffentlicht: (2024) -
Towards Learning a Generalist Model for Embodied Navigation
von: Zheng, Duo, et al.
Veröffentlicht: (2023) -
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
von: Zhu, Junyou, et al.
Veröffentlicht: (2024) -
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
von: Yang, Jiahao, et al.
Veröffentlicht: (2026)