Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Song, Xinshuai, Chen, Weixing, Liu, Yang, Chen, Weikai, Li, Guanbin, Lin, Liang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
von: Zhao, Ganlong, et al.
Veröffentlicht: (2024)
von: Zhao, Ganlong, et al.
Veröffentlicht: (2024)
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
von: Wang, Xiangyu, et al.
Veröffentlicht: (2024)
von: Wang, Xiangyu, et al.
Veröffentlicht: (2024)
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
von: Wang, Kuo, et al.
Veröffentlicht: (2024)
von: Wang, Kuo, et al.
Veröffentlicht: (2024)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)
Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering
von: Jiang, Kaixuan, et al.
Veröffentlicht: (2025)
von: Jiang, Kaixuan, et al.
Veröffentlicht: (2025)
GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
von: Li, Jiaming, et al.
Veröffentlicht: (2026)
von: Li, Jiaming, et al.
Veröffentlicht: (2026)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
von: Yin, Shicheng, et al.
Veröffentlicht: (2026)
von: Yin, Shicheng, et al.
Veröffentlicht: (2026)
3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians
von: Wei, Zeming, et al.
Veröffentlicht: (2025)
von: Wei, Zeming, et al.
Veröffentlicht: (2025)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
von: Luo, Jingzhou, et al.
Veröffentlicht: (2025)
von: Luo, Jingzhou, et al.
Veröffentlicht: (2025)
Cross-Modal Causal Intervention for Medical Report Generation
von: Chen, Weixing, et al.
Veröffentlicht: (2023)
von: Chen, Weixing, et al.
Veröffentlicht: (2023)
Aerial Vision-and-Language Navigation with Grid-based View Selection and Map Construction
von: Zhao, Ganlong, et al.
Veröffentlicht: (2025)
von: Zhao, Ganlong, et al.
Veröffentlicht: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models
von: Yin, Shicheng, et al.
Veröffentlicht: (2025)
von: Yin, Shicheng, et al.
Veröffentlicht: (2025)
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
von: Jiang, Wen, et al.
Veröffentlicht: (2025)
von: Jiang, Wen, et al.
Veröffentlicht: (2025)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
von: Liang, Xiwen, et al.
Veröffentlicht: (2025)
von: Liang, Xiwen, et al.
Veröffentlicht: (2025)
PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation
von: Chen, Weixing, et al.
Veröffentlicht: (2026)
von: Chen, Weixing, et al.
Veröffentlicht: (2026)
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
von: Zhang, Ruifei, et al.
Veröffentlicht: (2025)
von: Zhang, Ruifei, et al.
Veröffentlicht: (2025)
MedHorizon: Towards Long-context Medical Video Understanding in the Wild
von: Du, Bodong, et al.
Veröffentlicht: (2026)
von: Du, Bodong, et al.
Veröffentlicht: (2026)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
von: Zhang, Yuelin, et al.
Veröffentlicht: (2026)
von: Zhang, Yuelin, et al.
Veröffentlicht: (2026)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
von: Zhang, Ruizhi, et al.
Veröffentlicht: (2026)
von: Zhang, Ruizhi, et al.
Veröffentlicht: (2026)
AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning
von: Chen, Weixing, et al.
Veröffentlicht: (2025)
von: Chen, Weixing, et al.
Veröffentlicht: (2025)
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
von: Bai, Yongjie, et al.
Veröffentlicht: (2025)
von: Bai, Yongjie, et al.
Veröffentlicht: (2025)
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
ODMixer: Fine-grained Spatial-temporal MLP for Metro Origin-Destination Prediction
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
von: Lin, Bingqian, et al.
Veröffentlicht: (2023)
von: Lin, Bingqian, et al.
Veröffentlicht: (2023)
DeepShield: Fortifying Deepfake Video Detection with Local and Global Forgery Analysis
von: Cai, Yinqi, et al.
Veröffentlicht: (2025)
von: Cai, Yinqi, et al.
Veröffentlicht: (2025)
VisionGRU: A Linear-Complexity RNN Model for Efficient Image Analysis
von: Yin, Shicheng, et al.
Veröffentlicht: (2024)
von: Yin, Shicheng, et al.
Veröffentlicht: (2024)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
von: Su, Xia, et al.
Veröffentlicht: (2026)
von: Su, Xia, et al.
Veröffentlicht: (2026)
GeoSplatting: Towards Geometry Guided Gaussian Splatting for Physically-based Inverse Rendering
von: Ye, Kai, et al.
Veröffentlicht: (2024)
von: Ye, Kai, et al.
Veröffentlicht: (2024)
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
von: Hu, Yue, et al.
Veröffentlicht: (2026)
von: Hu, Yue, et al.
Veröffentlicht: (2026)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
von: Li, Jiangyang, et al.
Veröffentlicht: (2026)
von: Li, Jiangyang, et al.
Veröffentlicht: (2026)
MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
von: Ren, Xiyu, et al.
Veröffentlicht: (2026)
von: Ren, Xiyu, et al.
Veröffentlicht: (2026)
Volumetric Environment Representation for Vision-Language Navigation
von: Liu, Rui, et al.
Veröffentlicht: (2024)
von: Liu, Rui, et al.
Veröffentlicht: (2024)
Vision-Language Navigation with Energy-Based Policy
von: Liu, Rui, et al.
Veröffentlicht: (2024)
von: Liu, Rui, et al.
Veröffentlicht: (2024)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
von: Wu, Ruipu, et al.
Veröffentlicht: (2025)
von: Wu, Ruipu, et al.
Veröffentlicht: (2025)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
von: Wang, Liuyi, et al.
Veröffentlicht: (2023)
von: Wang, Liuyi, et al.
Veröffentlicht: (2023)
Credible Teacher for Semi-Supervised Object Detection in Open Scene
von: Zhuang, Jingyu, et al.
Veröffentlicht: (2024)
von: Zhuang, Jingyu, et al.
Veröffentlicht: (2024)
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
von: Liu, Zhen, et al.
Veröffentlicht: (2026)
von: Liu, Zhen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
von: Liu, Yang, et al.
Veröffentlicht: (2024) -
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
von: Zhao, Ganlong, et al.
Veröffentlicht: (2024) -
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
von: Wang, Xiangyu, et al.
Veröffentlicht: (2024) -
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
von: Wang, Kuo, et al.
Veröffentlicht: (2024) -
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
von: Ning, Yuwei, et al.
Veröffentlicht: (2026)