Vision-Language Navigation with Embodied Intelligence: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Peng, Wang, Peng, Gao, Feng, Wang, Fei, Yuan, Ruyue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OctoNav: Towards Generalist Embodied Navigation
por: Gao, Chen, et al.
Publicado: (2025)
por: Gao, Chen, et al.
Publicado: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
FloNa: Floor Plan Guided Embodied Visual Navigation
por: Li, Jiaxin, et al.
Publicado: (2024)
por: Li, Jiaxin, et al.
Publicado: (2024)
What Limits Vision-and-Language Navigation ?
por: Wang, Yunheng, et al.
Publicado: (2026)
por: Wang, Yunheng, et al.
Publicado: (2026)
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
Embodied Navigation at the Art Gallery
por: Bigazzi, Roberto, et al.
Publicado: (2022)
por: Bigazzi, Roberto, et al.
Publicado: (2022)
AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control
por: Xu, Peng, et al.
Publicado: (2026)
por: Xu, Peng, et al.
Publicado: (2026)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
por: Dong, Xiangyu, et al.
Publicado: (2025)
por: Dong, Xiangyu, et al.
Publicado: (2025)
MapDream: Task-Driven Map Learning for Vision-Language Navigation
por: Lian, Guoxin, et al.
Publicado: (2026)
por: Lian, Guoxin, et al.
Publicado: (2026)
WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
por: Chen, Hongjin, et al.
Publicado: (2026)
por: Chen, Hongjin, et al.
Publicado: (2026)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
por: Chu, Zedong, et al.
Publicado: (2026)
por: Chu, Zedong, et al.
Publicado: (2026)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
por: Zhang, Zekai, et al.
Publicado: (2025)
por: Zhang, Zekai, et al.
Publicado: (2025)
A Survey on Efficient Vision-Language-Action Models
por: Yu, Zhaoshu, et al.
Publicado: (2025)
por: Yu, Zhaoshu, et al.
Publicado: (2025)
BEACON: Language-Conditioned Navigation Affordance Prediction under Occlusion
por: Gao, Xinyu, et al.
Publicado: (2026)
por: Gao, Xinyu, et al.
Publicado: (2026)
A Navigation Framework Utilizing Vision-Language Models
por: Duan, Yicheng, et al.
Publicado: (2025)
por: Duan, Yicheng, et al.
Publicado: (2025)
The Safety Challenge of World Models for Embodied AI Agents: A Review
por: Baraldi, Lorenzo, et al.
Publicado: (2025)
por: Baraldi, Lorenzo, et al.
Publicado: (2025)
SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning
por: Shen, Zichao, et al.
Publicado: (2025)
por: Shen, Zichao, et al.
Publicado: (2025)
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
por: Wei, Ziyu, et al.
Publicado: (2026)
por: Wei, Ziyu, et al.
Publicado: (2026)
Physically Grounded Vision-Language Models for Robotic Manipulation
por: Gao, Jensen, et al.
Publicado: (2023)
por: Gao, Jensen, et al.
Publicado: (2023)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
por: Wang, Yunheng, et al.
Publicado: (2025)
por: Wang, Yunheng, et al.
Publicado: (2025)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
por: Zhang, Jiwen, et al.
Publicado: (2026)
por: Zhang, Jiwen, et al.
Publicado: (2026)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
por: Lei, Zixing, et al.
Publicado: (2026)
por: Lei, Zixing, et al.
Publicado: (2026)
SKT: Integrating State-Aware Keypoint Trajectories with Vision-Language Models for Robotic Garment Manipulation
por: Li, Xin, et al.
Publicado: (2024)
por: Li, Xin, et al.
Publicado: (2024)
Dejavu: Towards Experience Feedback Learning for Embodied Intelligence
por: Wu, Shaokai, et al.
Publicado: (2025)
por: Wu, Shaokai, et al.
Publicado: (2025)
PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models
por: Rouhi, Amirreza, et al.
Publicado: (2026)
por: Rouhi, Amirreza, et al.
Publicado: (2026)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
por: Wang, Yunheng, et al.
Publicado: (2025)
por: Wang, Yunheng, et al.
Publicado: (2025)
A Survey on Improving Human Robot Collaboration through Vision-and-Language Navigation
por: Yakolli, Nivedan, et al.
Publicado: (2025)
por: Yakolli, Nivedan, et al.
Publicado: (2025)
RynnEC: Bringing MLLMs into Embodied World
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
Octopus: Embodied Vision-Language Programmer from Environmental Feedback
por: Yang, Jingkang, et al.
Publicado: (2023)
por: Yang, Jingkang, et al.
Publicado: (2023)
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
por: Li, Xiao, et al.
Publicado: (2026)
por: Li, Xiao, et al.
Publicado: (2026)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)
por: Wang, Yiru, et al.
Publicado: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
por: Han, Mingfei, et al.
Publicado: (2024)
por: Han, Mingfei, et al.
Publicado: (2024)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
por: Chen, Ziyi, et al.
Publicado: (2025)
por: Chen, Ziyi, et al.
Publicado: (2025)
Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning
por: Fang, Jiading
Publicado: (2025)
por: Fang, Jiading
Publicado: (2025)
g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
Ejemplares similares
-
OctoNav: Towards Generalist Embodied Navigation
por: Gao, Chen, et al.
Publicado: (2025) -
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025) -
FloNa: Floor Plan Guided Embodied Visual Navigation
por: Li, Jiaxin, et al.
Publicado: (2024) -
What Limits Vision-and-Language Navigation ?
por: Wang, Yunheng, et al.
Publicado: (2026) -
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)