\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Weiye, Zhang, Zekai, Wang, Xiangchen, Pan, Hewei, Wang, Teng, Geng, Tiantian, Xu, Rongtao, Zheng, Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
por: Zhang, Zekai, et al.
Publicado: (2025)
por: Zhang, Zekai, et al.
Publicado: (2025)
LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation
por: Wang, Xiangchen, et al.
Publicado: (2026)
por: Wang, Xiangchen, et al.
Publicado: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
por: Wang, Xiangchen, et al.
Publicado: (2025)
por: Wang, Xiangchen, et al.
Publicado: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
por: Chen, Kehan, et al.
Publicado: (2024)
por: Chen, Kehan, et al.
Publicado: (2024)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
por: Zhu, Lu, et al.
Publicado: (2025)
por: Zhu, Lu, et al.
Publicado: (2025)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
por: Han, Xiaofeng, et al.
Publicado: (2025)
por: Han, Xiaofeng, et al.
Publicado: (2025)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
por: Xu, Wenhao, et al.
Publicado: (2025)
por: Xu, Wenhao, et al.
Publicado: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
por: Pan, Yiyuan, et al.
Publicado: (2024)
por: Pan, Yiyuan, et al.
Publicado: (2024)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
por: Zheng, Qi, et al.
Publicado: (2023)
por: Zheng, Qi, et al.
Publicado: (2023)
What Limits Vision-and-Language Navigation ?
por: Wang, Yunheng, et al.
Publicado: (2026)
por: Wang, Yunheng, et al.
Publicado: (2026)
Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026)
por: Peng, Jiankun, et al.
Publicado: (2026)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
por: Zhang, Jinrui, et al.
Publicado: (2024)
por: Zhang, Jinrui, et al.
Publicado: (2024)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
por: You, Weihang, et al.
Publicado: (2026)
por: You, Weihang, et al.
Publicado: (2026)
$\mathcal{P}^3$: Toward Versatile Embodied Agents
por: Zhou, Shengli, et al.
Publicado: (2025)
por: Zhou, Shengli, et al.
Publicado: (2025)
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
por: Zhang, Zherui, et al.
Publicado: (2025)
por: Zhang, Zherui, et al.
Publicado: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
Dynamic Vision Mamba
por: Wu, Mengxuan, et al.
Publicado: (2025)
por: Wu, Mengxuan, et al.
Publicado: (2025)
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
por: Lin, Zekai, et al.
Publicado: (2026)
por: Lin, Zekai, et al.
Publicado: (2026)
CP2M: Clustered-Patch-Mixed Mosaic Augmentation for Aerial Image Segmentation
por: Li, Yijie, et al.
Publicado: (2025)
por: Li, Yijie, et al.
Publicado: (2025)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
por: Ding, Xichen, et al.
Publicado: (2025)
por: Ding, Xichen, et al.
Publicado: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
por: Zhao, Baining, et al.
Publicado: (2026)
por: Zhao, Baining, et al.
Publicado: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation
por: Li, Qiming, et al.
Publicado: (2025)
por: Li, Qiming, et al.
Publicado: (2025)
Volumetric Environment Representation for Vision-Language Navigation
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Vision-Language Navigation with Energy-Based Policy
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
por: Du, Fan, et al.
Publicado: (2026)
por: Du, Fan, et al.
Publicado: (2026)
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
HCF-Net: Hierarchical Context Fusion Network for Infrared Small Object Detection
por: Xu, Shibiao, et al.
Publicado: (2024)
por: Xu, Shibiao, et al.
Publicado: (2024)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
por: Lin, Bingqian, et al.
Publicado: (2025)
por: Lin, Bingqian, et al.
Publicado: (2025)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
por: Gu, Shutian, et al.
Publicado: (2026)
por: Gu, Shutian, et al.
Publicado: (2026)
DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation
por: Liu, Ting, et al.
Publicado: (2023)
por: Liu, Ting, et al.
Publicado: (2023)
Ejemplares similares
-
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
por: Zhang, Zekai, et al.
Publicado: (2025) -
LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation
por: Wang, Xiangchen, et al.
Publicado: (2026) -
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024) -
Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
por: Wang, Xiangchen, et al.
Publicado: (2025) -
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)