SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Gengze, Hong, Yicong, Wang, Zun, Zhao, Chongyang, Bansal, Mohit, Wu, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
di: Zhao, Xunyi, et al.
Pubblicazione: (2025)
di: Zhao, Xunyi, et al.
Pubblicazione: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
di: Li, Zerui, et al.
Pubblicazione: (2025)
di: Li, Zerui, et al.
Pubblicazione: (2025)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
di: Wang, Zun, et al.
Pubblicazione: (2024)
di: Wang, Zun, et al.
Pubblicazione: (2024)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
Policy-Guided World Model Planning for Language-Conditioned Visual Navigation
di: Chahe, Amirhosein, et al.
Pubblicazione: (2026)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2026)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
di: An, Dong, et al.
Pubblicazione: (2023)
di: An, Dong, et al.
Pubblicazione: (2023)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
di: Zhou, Gengze, et al.
Pubblicazione: (2025)
di: Zhou, Gengze, et al.
Pubblicazione: (2025)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale
di: Li, Songze, et al.
Pubblicazione: (2025)
di: Li, Songze, et al.
Pubblicazione: (2025)
Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts
di: Feng, Qi
Pubblicazione: (2025)
di: Feng, Qi
Pubblicazione: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
DRAGON: A Dialogue-Based Robot for Assistive Navigation with Visual Language Grounding
di: Liu, Shuijing, et al.
Pubblicazione: (2023)
di: Liu, Shuijing, et al.
Pubblicazione: (2023)
Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
di: Chen, Jiaqi, et al.
Pubblicazione: (2024)
di: Chen, Jiaqi, et al.
Pubblicazione: (2024)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
Selective Exploration and Information Gathering in Search and Rescue Using Hierarchical Learning Guided by Natural Language Input
di: Panagopoulos, Dimitrios, et al.
Pubblicazione: (2024)
di: Panagopoulos, Dimitrios, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Generative Pretrained Transformer
di: Hanlin, Wen
Pubblicazione: (2024)
di: Hanlin, Wen
Pubblicazione: (2024)
SmallPlan: Leverage Small Language Models for Sequential Path Planning with Simulation-Powered, LLM-Guided Distillation
di: Pham, Quang P. M., et al.
Pubblicazione: (2025)
di: Pham, Quang P. M., et al.
Pubblicazione: (2025)
Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2025)
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
di: Wang, Zun, et al.
Pubblicazione: (2024)
di: Wang, Zun, et al.
Pubblicazione: (2024)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
di: Chen, Bolei, et al.
Pubblicazione: (2025)
di: Chen, Bolei, et al.
Pubblicazione: (2025)
OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models
di: Kuang, Yuxuan, et al.
Pubblicazione: (2024)
di: Kuang, Yuxuan, et al.
Pubblicazione: (2024)
IPPON: Common Sense Guided Informative Path Planning for Object Goal Navigation
di: Qu, Kaixian, et al.
Pubblicazione: (2024)
di: Qu, Kaixian, et al.
Pubblicazione: (2024)
Statler: State-Maintaining Language Models for Embodied Reasoning
di: Yoneda, Takuma, et al.
Pubblicazione: (2023)
di: Yoneda, Takuma, et al.
Pubblicazione: (2023)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
di: Huang, Yidong, et al.
Pubblicazione: (2025)
di: Huang, Yidong, et al.
Pubblicazione: (2025)
3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow
di: Ma, Yueen, et al.
Pubblicazione: (2025)
di: Ma, Yueen, et al.
Pubblicazione: (2025)
PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models
di: Zhu, Wang Bill, et al.
Pubblicazione: (2025)
di: Zhu, Wang Bill, et al.
Pubblicazione: (2025)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
di: Lin, Sihao, et al.
Pubblicazione: (2025)
di: Lin, Sihao, et al.
Pubblicazione: (2025)
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
di: Song, Siqi, et al.
Pubblicazione: (2025)
di: Song, Siqi, et al.
Pubblicazione: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
LGR2: Language Guided Reward Relabeling for Accelerating Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
di: Yang, Yue, et al.
Pubblicazione: (2023)
di: Yang, Yue, et al.
Pubblicazione: (2023)
Mind the Error! Detection and Localization of Instruction Errors in Vision-and-Language Navigation
di: Taioli, Francesco, et al.
Pubblicazione: (2024)
di: Taioli, Francesco, et al.
Pubblicazione: (2024)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
di: Su, Hung-Ting, et al.
Pubblicazione: (2026)
di: Su, Hung-Ting, et al.
Pubblicazione: (2026)
What Limits Vision-and-Language Navigation ?
di: Wang, Yunheng, et al.
Pubblicazione: (2026)
di: Wang, Yunheng, et al.
Pubblicazione: (2026)
Stable Language Guidance for Vision-Language-Action Models
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024) -
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
di: Zhao, Xunyi, et al.
Pubblicazione: (2025) -
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
di: Li, Zerui, et al.
Pubblicazione: (2025) -
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
di: Wang, Zun, et al.
Pubblicazione: (2024) -
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)