What Limits Vision-and-Language Navigation ?
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yunheng, Fang, Yuetong, Wang, Taowen, Li, Lusong, Liu, Kun, Xu, Junzhe, Yuan, Zizhao, Feng, Yixiao, Zhang, Jiaxi, Lu, Wei, Zeng, Zecui, Xu, Renjing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
por: Wang, Yunheng, et al.
Publicado: (2025)
por: Wang, Yunheng, et al.
Publicado: (2025)
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
por: Zhang, Jiaxi, et al.
Publicado: (2026)
por: Zhang, Jiaxi, et al.
Publicado: (2026)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
por: Wang, Yunheng, et al.
Publicado: (2025)
por: Wang, Yunheng, et al.
Publicado: (2025)
Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model
por: Xu, Wenjiang, et al.
Publicado: (2025)
por: Xu, Wenjiang, et al.
Publicado: (2025)
Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control
por: Xu, Weisheng, et al.
Publicado: (2026)
por: Xu, Weisheng, et al.
Publicado: (2026)
VANP: Learning Where to See for Navigation with Self-Supervised Vision-Action Pre-Training
por: Nazeri, Mohammad, et al.
Publicado: (2024)
por: Nazeri, Mohammad, et al.
Publicado: (2024)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
Spiking Neural Networks Need High Frequency Information
por: Fang, Yuetong, et al.
Publicado: (2025)
por: Fang, Yuetong, et al.
Publicado: (2025)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
por: Zhao, Baining, et al.
Publicado: (2026)
por: Zhao, Baining, et al.
Publicado: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
PDF-HR: Pose Distance Fields for Humanoid Robots
por: Gu, Yi, et al.
Publicado: (2026)
por: Gu, Yi, et al.
Publicado: (2026)
ViTaMIn-B: A Reliable and Efficient Visuo-Tactile Bimanual Manipulation Interface
por: Li, Chuanyu, et al.
Publicado: (2025)
por: Li, Chuanyu, et al.
Publicado: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
TDSNNs: Competitive Topographic Deep Spiking Neural Networks for Visual Cortex Modeling
por: Zhou, Deming, et al.
Publicado: (2025)
por: Zhou, Deming, et al.
Publicado: (2025)
Spherical Latent Motion Prior for Physics-Based Simulated Humanoid Control
por: Tan, Jing, et al.
Publicado: (2026)
por: Tan, Jing, et al.
Publicado: (2026)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
por: Zeng, Shuang, et al.
Publicado: (2025)
por: Zeng, Shuang, et al.
Publicado: (2025)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
por: Liu, Youzhi, et al.
Publicado: (2024)
por: Liu, Youzhi, et al.
Publicado: (2024)
AdaMorph: Unified Motion Retargeting via Embodiment-Aware Adaptive Transformers
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
Reflection-Based Task Adaptation for Self-Improving VLA
por: Li, Baicheng, et al.
Publicado: (2025)
por: Li, Baicheng, et al.
Publicado: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
por: Yin, Hang, et al.
Publicado: (2025)
por: Yin, Hang, et al.
Publicado: (2025)
See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model
por: Feng, Yixu, et al.
Publicado: (2026)
por: Feng, Yixu, et al.
Publicado: (2026)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
por: Chen, Kehan, et al.
Publicado: (2024)
por: Chen, Kehan, et al.
Publicado: (2024)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
por: Pan, Yiyuan, et al.
Publicado: (2024)
por: Pan, Yiyuan, et al.
Publicado: (2024)
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
NavQ: Learning a Q-Model for Foresighted Vision-and-Language Navigation
por: Xu, Peiran, et al.
Publicado: (2025)
por: Xu, Peiran, et al.
Publicado: (2025)
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
por: Bao, Muyi, et al.
Publicado: (2026)
por: Bao, Muyi, et al.
Publicado: (2026)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
por: Zhang, Zekai, et al.
Publicado: (2025)
por: Zhang, Zekai, et al.
Publicado: (2025)
Adaptive Calibration: A Unified Conversion Framework of Spiking Neural Networks
por: Wang, Ziqing, et al.
Publicado: (2023)
por: Wang, Ziqing, et al.
Publicado: (2023)
Chasing Day and Night: Towards Robust and Efficient All-Day Object Detection Guided by an Event Camera
por: Cao, Jiahang, et al.
Publicado: (2023)
por: Cao, Jiahang, et al.
Publicado: (2023)
MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming
por: Wang, Shuo, et al.
Publicado: (2025)
por: Wang, Shuo, et al.
Publicado: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
por: Zhou, Jiaming, et al.
Publicado: (2025)
por: Zhou, Jiaming, et al.
Publicado: (2025)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
por: Shi, Haoxiang, et al.
Publicado: (2025)
por: Shi, Haoxiang, et al.
Publicado: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
por: Wang, Zhaowei, et al.
Publicado: (2024)
por: Wang, Zhaowei, et al.
Publicado: (2024)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
por: Chen, Bolei, et al.
Publicado: (2025)
por: Chen, Bolei, et al.
Publicado: (2025)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
por: Qiao, Yanyuan, et al.
Publicado: (2024)
por: Qiao, Yanyuan, et al.
Publicado: (2024)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
Ejemplares similares
-
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
por: Wang, Yunheng, et al.
Publicado: (2025) -
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
por: Zhang, Jiaxi, et al.
Publicado: (2026) -
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
por: Wang, Yunheng, et al.
Publicado: (2025) -
Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model
por: Xu, Wenjiang, et al.
Publicado: (2025) -
Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control
por: Xu, Weisheng, et al.
Publicado: (2026)