Towards Learning a Generalist Model for Embodied Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Duo, Huang, Shijia, Zhao, Lin, Zhong, Yiwu, Wang, Liwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
di: Zheng, Duo, et al.
Pubblicazione: (2025)
di: Zheng, Duo, et al.
Pubblicazione: (2025)
OctoNav: Towards Generalist Embodied Navigation
di: Gao, Chen, et al.
Pubblicazione: (2025)
di: Gao, Chen, et al.
Pubblicazione: (2025)
Enhancing Temporal Modeling of Video LLMs via Time Gating
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
di: Zheng, Duo, et al.
Pubblicazione: (2025)
di: Zheng, Duo, et al.
Pubblicazione: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
di: Zheng, Duo, et al.
Pubblicazione: (2024)
di: Zheng, Duo, et al.
Pubblicazione: (2024)
Rethinking Chain-of-Thought Reasoning for Videos
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
An Embodied Generalist Agent in 3D World
di: Huang, Jiangyong, et al.
Pubblicazione: (2023)
di: Huang, Jiangyong, et al.
Pubblicazione: (2023)
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
di: Feng, Yao, et al.
Pubblicazione: (2025)
di: Feng, Yao, et al.
Pubblicazione: (2025)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
di: Hung, Chia-Yu, et al.
Pubblicazione: (2025)
di: Hung, Chia-Yu, et al.
Pubblicazione: (2025)
Vision Generalist Model: A Survey
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
di: Wang, Shansong, et al.
Pubblicazione: (2025)
di: Wang, Shansong, et al.
Pubblicazione: (2025)
FloNa: Floor Plan Guided Embodied Visual Navigation
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
di: Ye, Sen, et al.
Pubblicazione: (2026)
di: Ye, Sen, et al.
Pubblicazione: (2026)
Embodied Navigation at the Art Gallery
di: Bigazzi, Roberto, et al.
Pubblicazione: (2022)
di: Bigazzi, Roberto, et al.
Pubblicazione: (2022)
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
di: Shi, Danli, et al.
Pubblicazione: (2024)
di: Shi, Danli, et al.
Pubblicazione: (2024)
Vision-Language Navigation with Embodied Intelligence: A Survey
di: Gao, Peng, et al.
Pubblicazione: (2024)
di: Gao, Peng, et al.
Pubblicazione: (2024)
Navigation as Attackers Wish? Towards Building Robust Embodied Agents under Federated Learning
di: Zhang, Yunchao, et al.
Pubblicazione: (2022)
di: Zhang, Yunchao, et al.
Pubblicazione: (2022)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
di: Chu, Zedong, et al.
Pubblicazione: (2026)
di: Chu, Zedong, et al.
Pubblicazione: (2026)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
di: Gu, Shutian, et al.
Pubblicazione: (2026)
di: Gu, Shutian, et al.
Pubblicazione: (2026)
EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
Normal-Abnormal Guided Generalist Anomaly Detection
di: Wang, Yuexin, et al.
Pubblicazione: (2025)
di: Wang, Yuexin, et al.
Pubblicazione: (2025)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
Dejavu: Towards Experience Feedback Learning for Embodied Intelligence
di: Wu, Shaokai, et al.
Pubblicazione: (2025)
di: Wu, Shaokai, et al.
Pubblicazione: (2025)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
Navigating Beyond Dropout: An Intriguing Solution Towards Generalizable Image Super Resolution
di: Wang, Hongjun, et al.
Pubblicazione: (2024)
di: Wang, Hongjun, et al.
Pubblicazione: (2024)
PAVE: Patching and Adapting Video Large Language Models
di: Liu, Zhuoming, et al.
Pubblicazione: (2025)
di: Liu, Zhuoming, et al.
Pubblicazione: (2025)
pFedNavi: Structure-Aware Personalized Federated Vision-Language Navigation for Embodied AI
di: Yang, Qingqian, et al.
Pubblicazione: (2026)
di: Yang, Qingqian, et al.
Pubblicazione: (2026)
Image Generators are Generalist Vision Learners
di: Gabeur, Valentin, et al.
Pubblicazione: (2026)
di: Gabeur, Valentin, et al.
Pubblicazione: (2026)
From Specialist to Generalist: Unlocking SAM's Learning Potential on Unlabeled Medical Images
di: Vu, Vi, et al.
Pubblicazione: (2026)
di: Vu, Vi, et al.
Pubblicazione: (2026)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
Universal Actions for Enhanced Embodied Foundation Models
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
di: Zheng, Jinliang, et al.
Pubblicazione: (2025)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
Self-Explainable Affordance Learning with Embodied Caption
di: Zhang, Zhipeng, et al.
Pubblicazione: (2024)
di: Zhang, Zhipeng, et al.
Pubblicazione: (2024)
Learning Additively Compositional Latent Actions for Embodied AI
di: Wei, Hangxing, et al.
Pubblicazione: (2026)
di: Wei, Hangxing, et al.
Pubblicazione: (2026)
EmbRACE-3K: Embodied Reasoning and Action in Complex Environments
di: Lin, Mingxian, et al.
Pubblicazione: (2025)
di: Lin, Mingxian, et al.
Pubblicazione: (2025)
RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy
di: Chen, Aiyue, et al.
Pubblicazione: (2025)
di: Chen, Aiyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
di: Zheng, Duo, et al.
Pubblicazione: (2025) -
OctoNav: Towards Generalist Embodied Navigation
di: Gao, Chen, et al.
Pubblicazione: (2025) -
Enhancing Temporal Modeling of Video LLMs via Time Gating
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024) -
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
di: Zheng, Duo, et al.
Pubblicazione: (2025) -
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)