MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Shuo, Wang, Yongcai, Fan, Zhaoxin, Wang, Yucheng, Chen, Maiyue, Wang, Kaihui, Su, Zhizhong, Li, Wanting, Cai, Xudong, Jin, Yeying, Li, Deying |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MapDream: Task-Driven Map Learning for Vision-Language Navigation
by: Lian, Guoxin, et al.
Published: (2026)
by: Lian, Guoxin, et al.
Published: (2026)
Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
by: Wang, Shuo, et al.
Published: (2025)
by: Wang, Shuo, et al.
Published: (2025)
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
by: Wang, Shuo, et al.
Published: (2025)
by: Wang, Shuo, et al.
Published: (2025)
IDLS: Inverse Depth Line based Visual-Inertial SLAM
by: Li, Wanting, et al.
Published: (2023)
by: Li, Wanting, et al.
Published: (2023)
Mem4D: Decoupling Static and Dynamic Memory for Dynamic Scene Reconstruction
by: Cai, Xudong, et al.
Published: (2025)
by: Cai, Xudong, et al.
Published: (2025)
FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph
by: Zhou, Xiaolin, et al.
Published: (2025)
by: Zhou, Xiaolin, et al.
Published: (2025)
MambaVO: Deep Visual Odometry Based on Sequential Matching Refinement and Training Smoothing
by: Wang, Shuo, et al.
Published: (2024)
by: Wang, Shuo, et al.
Published: (2024)
HoloMotion-1 Technical Report
by: Chen, Maiyue, et al.
Published: (2026)
by: Chen, Maiyue, et al.
Published: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
by: Zhang, Wenyao, et al.
Published: (2025)
by: Zhang, Wenyao, et al.
Published: (2025)
Dust to Tower: Coarse-to-Fine Photo-Realistic Scene Reconstruction from Sparse Uncalibrated Images
by: Cai, Xudong, et al.
Published: (2024)
by: Cai, Xudong, et al.
Published: (2024)
CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
by: Sun, Nan, et al.
Published: (2025)
by: Sun, Nan, et al.
Published: (2025)
Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments
by: Meng, Xiangqi, et al.
Published: (2026)
by: Meng, Xiangqi, et al.
Published: (2026)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
by: Wang, Yunheng, et al.
Published: (2025)
by: Wang, Yunheng, et al.
Published: (2025)
RoCo:Robust Collaborative Perception By Iterative Object Matching and Pose Adjustment
by: Huang, Zhe, et al.
Published: (2024)
by: Huang, Zhe, et al.
Published: (2024)
Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation
by: Gu, Songen, et al.
Published: (2026)
by: Gu, Songen, et al.
Published: (2026)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
by: Hao, Haihong, et al.
Published: (2026)
by: Hao, Haihong, et al.
Published: (2026)
MonoSLAM: Robust Monocular SLAM with Global Structure Optimization
by: Jiang, Bingzheng, et al.
Published: (2025)
by: Jiang, Bingzheng, et al.
Published: (2025)
DreamToNav: Generalizable Navigation for Robots via Generative Video Planning
by: Serpiva, Valerii, et al.
Published: (2026)
by: Serpiva, Valerii, et al.
Published: (2026)
MonoMPC: Monocular Vision Based Navigation with Learned Collision Model and Risk-Aware Model Predictive Control
by: Sharma, Basant, et al.
Published: (2025)
by: Sharma, Basant, et al.
Published: (2025)
DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
by: Jia, Emily Yue-Ting, et al.
Published: (2026)
by: Jia, Emily Yue-Ting, et al.
Published: (2026)
DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies
by: Fan, Xianzhe, et al.
Published: (2026)
by: Fan, Xianzhe, et al.
Published: (2026)
GRUtopia: Dream General Robots in a City at Scale
by: Wang, Hanqing, et al.
Published: (2024)
by: Wang, Hanqing, et al.
Published: (2024)
Nightmare Dreamer: Dreaming About Unsafe States And Planning Ahead
by: Oseni, Oluwatosin, et al.
Published: (2026)
by: Oseni, Oluwatosin, et al.
Published: (2026)
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
by: Xu, Yunzhe, et al.
Published: (2025)
by: Xu, Yunzhe, et al.
Published: (2025)
MonoPlane: Exploiting Monocular Geometric Cues for Generalizable 3D Plane Reconstruction
by: Zhao, Wang, et al.
Published: (2024)
by: Zhao, Wang, et al.
Published: (2024)
DreamFlow: Local Navigation Beyond Observation via Conditional Flow Matching in the Latent Space
by: Park, Jiwon, et al.
Published: (2026)
by: Park, Jiwon, et al.
Published: (2026)
VOLoc: Visual Place Recognition by Querying Compressed Lidar Map
by: Cai, Xudong, et al.
Published: (2024)
by: Cai, Xudong, et al.
Published: (2024)
DroneMOT: Drone-based Multi-Object Tracking Considering Detection Difficulties and Simultaneous Moving of Drones and Objects
by: Wang, Peng, et al.
Published: (2024)
by: Wang, Peng, et al.
Published: (2024)
AsynEIO: Asynchronous Monocular Event-Inertial Odometry Using Gaussian Process Regression
by: Wang, Zhixiang, et al.
Published: (2024)
by: Wang, Zhixiang, et al.
Published: (2024)
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
by: Fan, Yahao, et al.
Published: (2025)
by: Fan, Yahao, et al.
Published: (2025)
Learning Versatile Humanoid Manipulation with Touch Dreaming
by: Niu, Yaru, et al.
Published: (2026)
by: Niu, Yaru, et al.
Published: (2026)
RoboDream: Compositional World Models for Scalable Robot Data Synthesis
by: Ye, Junjie, et al.
Published: (2026)
by: Ye, Junjie, et al.
Published: (2026)
Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation
by: Zhao, Xiaobei, et al.
Published: (2025)
by: Zhao, Xiaobei, et al.
Published: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
by: Wang, Sen, et al.
Published: (2025)
by: Wang, Sen, et al.
Published: (2025)
VSFormer: Mining Correlations in Flexible View Set for Multi-view 3D Shape Understanding
by: Sun, Hongyu, et al.
Published: (2024)
by: Sun, Hongyu, et al.
Published: (2024)
ManiDreams: An Open-Source Library for Robust Object Manipulation via Uncertainty-aware Task-specific Intuitive Physics
by: Wang, Gaotian, et al.
Published: (2026)
by: Wang, Gaotian, et al.
Published: (2026)
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
by: Jang, Joel, et al.
Published: (2025)
by: Jang, Joel, et al.
Published: (2025)
MonoSIM: An open source SIL framework for Ackermann Vehicular Systems with Monocular Vision
by: Rahman, Shantanu, et al.
Published: (2026)
by: Rahman, Shantanu, et al.
Published: (2026)
MonoLSS: Learnable Sample Selection For Monocular 3D Detection
by: Li, Zhenjia, et al.
Published: (2023)
by: Li, Zhenjia, et al.
Published: (2023)
Similar Items
-
MapDream: Task-Driven Map Learning for Vision-Language Navigation
by: Lian, Guoxin, et al.
Published: (2026) -
Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
by: Wang, Shuo, et al.
Published: (2025) -
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
by: Wang, Shuo, et al.
Published: (2025) -
IDLS: Inverse Depth Line based Visual-Inertial SLAM
by: Li, Wanting, et al.
Published: (2023) -
Mem4D: Decoupling Static and Dynamic Memory for Dynamic Scene Reconstruction
by: Cai, Xudong, et al.
Published: (2025)