WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Baining, Xu, Jiacheng, Feng, Weicheng, Zhang, Xin, Wang, Zhaolu, Wang, Haoyang, Ji, Shilong, Wang, Ziyou, Fang, Jianjie, Zheng, Zhiheng, Zhang, Weichen, Shang, Yu, Wu, Wei, Gao, Chen, Chen, Xinlei, Li, Yong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
von: Fang, Jianjie, et al.
Veröffentlicht: (2026)
von: Fang, Jianjie, et al.
Veröffentlicht: (2026)
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
von: Zhao, Baining, et al.
Veröffentlicht: (2026)
von: Zhao, Baining, et al.
Veröffentlicht: (2026)
AirScape: An Aerial Generative World Model with Motion Controllability
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
von: Wang, Lirui, et al.
Veröffentlicht: (2025)
von: Wang, Lirui, et al.
Veröffentlicht: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
von: Gao, Chen, et al.
Veröffentlicht: (2024)
von: Gao, Chen, et al.
Veröffentlicht: (2024)
WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
von: Chen, Hongjin, et al.
Veröffentlicht: (2026)
von: Chen, Hongjin, et al.
Veröffentlicht: (2026)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
OpenVLN: Open-world Aerial Vision-Language Navigation
von: Lin, Peican, et al.
Veröffentlicht: (2025)
von: Lin, Peican, et al.
Veröffentlicht: (2025)
Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing Agents
von: Man, Fanhang, et al.
Veröffentlicht: (2025)
von: Man, Fanhang, et al.
Veröffentlicht: (2025)
SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation
von: Huang, Jingzhi, et al.
Veröffentlicht: (2026)
von: Huang, Jingzhi, et al.
Veröffentlicht: (2026)
WorldVLA: Towards Autoregressive Action World Model
von: Cen, Jun, et al.
Veröffentlicht: (2025)
von: Cen, Jun, et al.
Veröffentlicht: (2025)
LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation
von: Wang, Xiangchen, et al.
Veröffentlicht: (2026)
von: Wang, Xiangchen, et al.
Veröffentlicht: (2026)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
von: Qi, Zhangyang, et al.
Veröffentlicht: (2025)
AgentVLN: Towards Agentic Vision-and-Language Navigation
von: Xin, Zihao, et al.
Veröffentlicht: (2026)
von: Xin, Zihao, et al.
Veröffentlicht: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
von: Tong, Haoyu, et al.
Veröffentlicht: (2026)
ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning
von: Liu, Xuchen, et al.
Veröffentlicht: (2026)
von: Liu, Xuchen, et al.
Veröffentlicht: (2026)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
von: Zheng, Duo, et al.
Veröffentlicht: (2025)
von: Zheng, Duo, et al.
Veröffentlicht: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
von: Wei, Meng, et al.
Veröffentlicht: (2025)
von: Wei, Meng, et al.
Veröffentlicht: (2025)
T-araVLN: Translator for Agricultural Robotic Agents on Vision-and-Language Navigation
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
von: Liu, Kejia, et al.
Veröffentlicht: (2026)
von: Liu, Kejia, et al.
Veröffentlicht: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation
von: Xin, Zihao, et al.
Veröffentlicht: (2026)
von: Xin, Zihao, et al.
Veröffentlicht: (2026)
FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation
von: Chen, Kehan, et al.
Veröffentlicht: (2026)
von: Chen, Kehan, et al.
Veröffentlicht: (2026)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
von: Zhang, Zekai, et al.
Veröffentlicht: (2025)
von: Zhang, Zekai, et al.
Veröffentlicht: (2025)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph
von: Zhou, Xiaolin, et al.
Veröffentlicht: (2025)
von: Zhou, Xiaolin, et al.
Veröffentlicht: (2025)
MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation
von: Dai, Guangzhao, et al.
Veröffentlicht: (2024)
von: Dai, Guangzhao, et al.
Veröffentlicht: (2024)
LogisticsVLN: Vision-Language Navigation For Low-Altitude Terminal Delivery Based on Agentic UAVs
von: Zhang, Xinyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyuan, et al.
Veröffentlicht: (2025)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
von: Yang, Jiahao, et al.
Veröffentlicht: (2026)
von: Yang, Jiahao, et al.
Veröffentlicht: (2026)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
von: Su, Hung-Ting, et al.
Veröffentlicht: (2026)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
von: Shang, Yu, et al.
Veröffentlicht: (2026)
von: Shang, Yu, et al.
Veröffentlicht: (2026)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
von: Chen, Yuntao, et al.
Veröffentlicht: (2024)
von: Chen, Yuntao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
von: Fang, Jianjie, et al.
Veröffentlicht: (2026) -
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
von: Zhao, Baining, et al.
Veröffentlicht: (2026) -
AirScape: An Aerial Generative World Model with Motion Controllability
von: Zhao, Baining, et al.
Veröffentlicht: (2025) -
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
von: Zhao, Baining, et al.
Veröffentlicht: (2025) -
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)