Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sohn, Tin Stribor, Dillitzer, Maximilian, Corso, Jason J., Sax, Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
por: Sohn, Tin Stribor, et al.
Publicado: (2025)
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
por: Chen, Meng, et al.
Publicado: (2024)
por: Chen, Meng, et al.
Publicado: (2024)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
por: Lin, Sihao, et al.
Publicado: (2025)
por: Lin, Sihao, et al.
Publicado: (2025)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
por: Zhang, Jiyao, et al.
Publicado: (2026)
por: Zhang, Jiyao, et al.
Publicado: (2026)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
por: Ding, Hongyu, et al.
Publicado: (2026)
por: Ding, Hongyu, et al.
Publicado: (2026)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
por: Liu, Youzhi, et al.
Publicado: (2024)
por: Liu, Youzhi, et al.
Publicado: (2024)
Personalized Embodied Navigation for Portable Object Finding
por: Dorbala, Vishnu Sashank, et al.
Publicado: (2024)
por: Dorbala, Vishnu Sashank, et al.
Publicado: (2024)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Embodied Navigation at the Art Gallery
por: Bigazzi, Roberto, et al.
Publicado: (2022)
por: Bigazzi, Roberto, et al.
Publicado: (2022)
Embodied Navigation with Auxiliary Task of Action Description Prediction
por: Kondoh, Haru, et al.
Publicado: (2025)
por: Kondoh, Haru, et al.
Publicado: (2025)
Nav-R1: Reasoning and Navigation in Embodied Scenes
por: Liu, Qingxiang, et al.
Publicado: (2025)
por: Liu, Qingxiang, et al.
Publicado: (2025)
Bridging the Indoor-Outdoor Gap: Vision-Centric Instruction-Guided Embodied Navigation for the Last Meters
por: Zhao, Yuxiang, et al.
Publicado: (2026)
por: Zhao, Yuxiang, et al.
Publicado: (2026)
Embodied Scene Understanding for Vision Language Models via MetaVQA
por: Wang, Weizhen, et al.
Publicado: (2025)
por: Wang, Weizhen, et al.
Publicado: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
por: Ling, Yiran, et al.
Publicado: (2026)
por: Ling, Yiran, et al.
Publicado: (2026)
SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning
por: Yang, Yuyuan, et al.
Publicado: (2026)
por: Yang, Yuyuan, et al.
Publicado: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
por: Zhang, Qiyao, et al.
Publicado: (2026)
por: Zhang, Qiyao, et al.
Publicado: (2026)
OctoNav: Towards Generalist Embodied Navigation
por: Gao, Chen, et al.
Publicado: (2025)
por: Gao, Chen, et al.
Publicado: (2025)
Perception Matters: Enhancing Embodied AI with Uncertainty-Aware Semantic Segmentation
por: Prasanna, Sai, et al.
Publicado: (2024)
por: Prasanna, Sai, et al.
Publicado: (2024)
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
por: Zou, Ding, et al.
Publicado: (2025)
por: Zou, Ding, et al.
Publicado: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
por: Liu, Xinhao, et al.
Publicado: (2024)
por: Liu, Xinhao, et al.
Publicado: (2024)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
por: Wang, Shaoan, et al.
Publicado: (2026)
por: Wang, Shaoan, et al.
Publicado: (2026)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
por: Wang, Xinjie, et al.
Publicado: (2025)
por: Wang, Xinjie, et al.
Publicado: (2025)
ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation
por: Ao, Yuzhuo, et al.
Publicado: (2026)
por: Ao, Yuzhuo, et al.
Publicado: (2026)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
por: Ju, Yuanchen, et al.
Publicado: (2025)
por: Ju, Yuanchen, et al.
Publicado: (2025)
Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation
por: Wang, Ningnan, et al.
Publicado: (2025)
por: Wang, Ningnan, et al.
Publicado: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
FloNa: Floor Plan Guided Embodied Visual Navigation
por: Li, Jiaxin, et al.
Publicado: (2024)
por: Li, Jiaxin, et al.
Publicado: (2024)
TesserAct: Learning 4D Embodied World Models
por: Zhen, Haoyu, et al.
Publicado: (2025)
por: Zhen, Haoyu, et al.
Publicado: (2025)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
por: Zhao, Yanpeng, et al.
Publicado: (2026)
por: Zhao, Yanpeng, et al.
Publicado: (2026)
Image Quality Assessment for Embodied AI
por: Li, Chunyi, et al.
Publicado: (2025)
por: Li, Chunyi, et al.
Publicado: (2025)
Embodied Domain Adaptation for Object Detection
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
RoboTidy : A 3D Gaussian Splatting Household Tidying Benchmark for Embodied Navigation and Action
por: Sun, Xiaoquan, et al.
Publicado: (2025)
por: Sun, Xiaoquan, et al.
Publicado: (2025)
EmbodiedSplat: Personalized Real-to-Sim-to-Real Navigation with Gaussian Splats from a Mobile Device
por: Chhablani, Gunjan, et al.
Publicado: (2025)
por: Chhablani, Gunjan, et al.
Publicado: (2025)
Ejemplares similares
-
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
por: Sohn, Tin Stribor, et al.
Publicado: (2025) -
R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
por: Sohn, Tin Stribor, et al.
Publicado: (2025) -
A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving
por: Sohn, Tin Stribor, et al.
Publicado: (2025) -
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024) -
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
por: Chen, Meng, et al.
Publicado: (2024)