From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Honglin, Ma, Yukai, Wu, Wayne, Zhou, Bolei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Sidewalk Autopilot from Multi-Scale Imitation with Corrective Behavior Expansion
par: He, Honglin, et autres
Publié: (2026)
par: He, Honglin, et autres
Publié: (2026)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
par: Liu, Mingxuan, et autres
Publié: (2025)
par: Liu, Mingxuan, et autres
Publié: (2025)
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
par: Xie, Ziyang, et autres
Publié: (2025)
par: Xie, Ziyang, et autres
Publié: (2025)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
par: Wu, Wayne, et autres
Publié: (2024)
par: Wu, Wayne, et autres
Publié: (2024)
Towards Autonomous Micromobility through Scalable Urban Simulation
par: Wu, Wayne, et autres
Publié: (2025)
par: Wu, Wayne, et autres
Publié: (2025)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
par: Chen, Bolei, et autres
Publié: (2025)
par: Chen, Bolei, et autres
Publié: (2025)
AURA: Multimodal Shared Autonomy for Real-World Urban Navigation
par: Ma, Yukai, et autres
Publié: (2026)
par: Ma, Yukai, et autres
Publié: (2026)
SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction
par: Peng, Zhenghao, et autres
Publié: (2025)
par: Peng, Zhenghao, et autres
Publié: (2025)
VANP: Learning Where to See for Navigation with Self-Supervised Vision-Action Pre-Training
par: Nazeri, Mohammad, et autres
Publié: (2024)
par: Nazeri, Mohammad, et autres
Publié: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
par: Wang, Weizhen, et autres
Publié: (2025)
par: Wang, Weizhen, et autres
Publié: (2025)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
par: Mei, Yanghong, et autres
Publié: (2025)
par: Mei, Yanghong, et autres
Publié: (2025)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
par: Chen, Ziyi, et autres
Publié: (2025)
par: Chen, Ziyi, et autres
Publié: (2025)
VLD: Visual Language Goal Distance for Reinforcement Learning Navigation
par: Milikic, Lazar, et autres
Publié: (2025)
par: Milikic, Lazar, et autres
Publié: (2025)
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
par: Raychaudhuri, Sonia, et autres
Publié: (2024)
par: Raychaudhuri, Sonia, et autres
Publié: (2024)
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
par: Liu, Xinhao, et autres
Publié: (2024)
par: Liu, Xinhao, et autres
Publié: (2024)
A Pragmatic VLA Foundation Model
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
par: Chu, Zedong, et autres
Publié: (2026)
par: Chu, Zedong, et autres
Publié: (2026)
Collision-Aware Object-Goal Visual Navigation via Two-Stage Deep Reinforcement Learning
par: Wang, Hongwu, et autres
Publié: (2025)
par: Wang, Hongwu, et autres
Publié: (2025)
SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments
par: Sun, Jian, et autres
Publié: (2026)
par: Sun, Jian, et autres
Publié: (2026)
See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model
par: Feng, Yixu, et autres
Publié: (2026)
par: Feng, Yixu, et autres
Publié: (2026)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
par: Zhao, Xunyi, et autres
Publié: (2025)
par: Zhao, Xunyi, et autres
Publié: (2025)
Efficient Camera Exposure Control for Visual Odometry via Deep Reinforcement Learning
par: Zhang, Shuyang, et autres
Publié: (2024)
par: Zhang, Shuyang, et autres
Publié: (2024)
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
par: Xu, Tianyu, et autres
Publié: (2025)
par: Xu, Tianyu, et autres
Publié: (2025)
Learning to Generate Diverse Pedestrian Movements from Web Videos with Noisy Labels
par: Liu, Zhizheng, et autres
Publié: (2024)
par: Liu, Zhizheng, et autres
Publié: (2024)
Perspective from a Higher Dimension: Can 3D Geometric Priors Help Visual Floorplan Localization?
par: Chen, Bolei, et autres
Publié: (2025)
par: Chen, Bolei, et autres
Publié: (2025)
Adaptive Articulated Object Manipulation On The Fly with Foundation Model Reasoning and Part Grounding
par: Zhang, Xiaojie, et autres
Publié: (2025)
par: Zhang, Xiaojie, et autres
Publié: (2025)
Vision-Based Deep Reinforcement Learning of UAV Autonomous Navigation Using Privileged Information
par: Wang, Junqiao, et autres
Publié: (2024)
par: Wang, Junqiao, et autres
Publié: (2024)
MetricNet: Recovering Metric Scale in Generative Navigation Policies
par: Nayak, Abhijeet, et autres
Publié: (2025)
par: Nayak, Abhijeet, et autres
Publié: (2025)
Quadrotor Navigation using Reinforcement Learning with Privileged Information
par: Lee, Jonathan, et autres
Publié: (2025)
par: Lee, Jonathan, et autres
Publié: (2025)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
par: Peng, Daojie, et autres
Publié: (2026)
par: Peng, Daojie, et autres
Publié: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
par: Zhang, Jiazhao, et autres
Publié: (2024)
par: Zhang, Jiazhao, et autres
Publié: (2024)
GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss
par: Xu, Yangfan, et autres
Publié: (2026)
par: Xu, Yangfan, et autres
Publié: (2026)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
par: Li, Rong, et autres
Publié: (2024)
par: Li, Rong, et autres
Publié: (2024)
NVSim: Novel View Synthesis Simulator for Large Scale Indoor Navigation
par: Jeong, Mingyu, et autres
Publié: (2025)
par: Jeong, Mingyu, et autres
Publié: (2025)
PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators
par: Zeng, Kuo-Hao, et autres
Publié: (2024)
par: Zeng, Kuo-Hao, et autres
Publié: (2024)
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
par: Bai, Yongjie, et autres
Publié: (2025)
par: Bai, Yongjie, et autres
Publié: (2025)
ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations
par: Li, Zheng, et autres
Publié: (2025)
par: Li, Zheng, et autres
Publié: (2025)
What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
SELFI: Autonomous Self-Improvement with Reinforcement Learning for Social Navigation
par: Hirose, Noriaki, et autres
Publié: (2024)
par: Hirose, Noriaki, et autres
Publié: (2024)
Documents similaires
-
Learning Sidewalk Autopilot from Multi-Scale Imitation with Corrective Behavior Expansion
par: He, Honglin, et autres
Publié: (2026) -
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
par: Liu, Mingxuan, et autres
Publié: (2025) -
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
par: Xie, Ziyang, et autres
Publié: (2025) -
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
par: Wu, Wayne, et autres
Publié: (2024) -
Towards Autonomous Micromobility through Scalable Urban Simulation
par: Wu, Wayne, et autres
Publié: (2025)