Aerial Vision-and-Language Navigation with Grid-based View Selection and Map Construction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Ganlong, Li, Guanbin, Pan, Jia, Yu, Yizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
par: Zhao, Ganlong, et autres
Publié: (2024)
par: Zhao, Ganlong, et autres
Publié: (2024)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
par: Ning, Yuwei, et autres
Publié: (2026)
par: Ning, Yuwei, et autres
Publié: (2026)
3DGS-HPC: Distractor-free 3D Gaussian Splatting with Hybrid Patch-wise Classification
par: Chen, Jiahao, et autres
Publié: (2026)
par: Chen, Jiahao, et autres
Publié: (2026)
Adaptive Betweenness Clustering for Semi-Supervised Domain Adaptation
par: Li, Jichang, et autres
Publié: (2024)
par: Li, Jichang, et autres
Publié: (2024)
Inter-Domain Mixup for Semi-Supervised Domain Adaptation
par: Li, Jichang, et autres
Publié: (2024)
par: Li, Jichang, et autres
Publié: (2024)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
par: Wu, Ruipu, et autres
Publié: (2025)
par: Wu, Ruipu, et autres
Publié: (2025)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
par: Song, Xinshuai, et autres
Publié: (2024)
par: Song, Xinshuai, et autres
Publié: (2024)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
par: Ding, Xichen, et autres
Publié: (2025)
par: Ding, Xichen, et autres
Publié: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
FedDiv: Collaborative Noise Filtering for Federated Learning with Noisy Labels
par: Li, Jichang, et autres
Publié: (2023)
par: Li, Jichang, et autres
Publié: (2023)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026)
par: Gao, Jianzhe, et autres
Publié: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
par: Tong, Haoyu, et autres
Publié: (2026)
par: Tong, Haoyu, et autres
Publié: (2026)
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
par: Liu, Kejia, et autres
Publié: (2026)
par: Liu, Kejia, et autres
Publié: (2026)
Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation
par: Zhang, Hai, et autres
Publié: (2026)
par: Zhang, Hai, et autres
Publié: (2026)
OptiMVMap: Offline Vectorized Map Construction via Optimal Multi-vehicle Perspectives
par: Dan, Zedong, et autres
Publié: (2026)
par: Dan, Zedong, et autres
Publié: (2026)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
par: Zhang, Xuesong, et autres
Publié: (2024)
par: Zhang, Xuesong, et autres
Publié: (2024)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
par: Xu, Huilin, et autres
Publié: (2025)
par: Xu, Huilin, et autres
Publié: (2025)
Feed-Forward Gaussian Splatting from Sparse Aerial Views
par: Wu, Dongli, et autres
Publié: (2026)
par: Wu, Dongli, et autres
Publié: (2026)
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
par: Zhan, Zhaohuan, et autres
Publié: (2024)
par: Zhan, Zhaohuan, et autres
Publié: (2024)
MapDream: Task-Driven Map Learning for Vision-Language Navigation
par: Lian, Guoxin, et autres
Publié: (2026)
par: Lian, Guoxin, et autres
Publié: (2026)
ViVa-SAFELAND: a New Freeware for Safe Validation of Vision-based Navigation in Aerial Vehicles
par: Soriano-García, Miguel S., et autres
Publié: (2025)
par: Soriano-García, Miguel S., et autres
Publié: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026)
par: Gao, Jianzhe, et autres
Publié: (2026)
Skyeyes: Ground Roaming using Aerial View Images
par: Gao, Zhiyuan, et autres
Publié: (2024)
par: Gao, Zhiyuan, et autres
Publié: (2024)
AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis
par: Vuong, Khiem, et autres
Publié: (2025)
par: Vuong, Khiem, et autres
Publié: (2025)
Aerial-Ground Image Feature Matching via 3D Gaussian Splatting-based Intermediate View Rendering
par: Yu, Jiangxue, et autres
Publié: (2025)
par: Yu, Jiangxue, et autres
Publié: (2025)
AerialGo: Walking-through City View Generation from Aerial Perspectives
par: Zhao, Fuqiang, et autres
Publié: (2024)
par: Zhao, Fuqiang, et autres
Publié: (2024)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
par: Cui, Yibo, et autres
Publié: (2025)
par: Cui, Yibo, et autres
Publié: (2025)
Vision-Based Anti Unmanned Aerial Technology: Opportunities and Challenges
par: Ding, Guanghai, et autres
Publié: (2025)
par: Ding, Guanghai, et autres
Publié: (2025)
Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing
par: Lou, Meng, et autres
Publié: (2026)
par: Lou, Meng, et autres
Publié: (2026)
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025)
par: Shi, Cheng, et autres
Publié: (2025)
View Invariant Learning for Vision-Language Navigation in Continuous Environments
par: Sun, Josh Qixuan, et autres
Publié: (2025)
par: Sun, Josh Qixuan, et autres
Publié: (2025)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
par: Zhang, Siqi, et autres
Publié: (2025)
par: Zhang, Siqi, et autres
Publié: (2025)
From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models
par: Fan, Zicheng, et autres
Publié: (2025)
par: Fan, Zicheng, et autres
Publié: (2025)
Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps
par: Gwak, Chanyoung, et autres
Publié: (2026)
par: Gwak, Chanyoung, et autres
Publié: (2026)
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
par: Wang, Kuo, et autres
Publié: (2024)
par: Wang, Kuo, et autres
Publié: (2024)
Vision Transformers Need More Than Registers
par: Shi, Cheng, et autres
Publié: (2026)
par: Shi, Cheng, et autres
Publié: (2026)
AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network
par: Hu, Yu, et autres
Publié: (2026)
par: Hu, Yu, et autres
Publié: (2026)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
Documents similaires
-
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
par: Zhao, Ganlong, et autres
Publié: (2024) -
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
par: Ning, Yuwei, et autres
Publié: (2026) -
3DGS-HPC: Distractor-free 3D Gaussian Splatting with Hybrid Patch-wise Classification
par: Chen, Jiahao, et autres
Publié: (2026) -
Adaptive Betweenness Clustering for Semi-Supervised Domain Adaptation
par: Li, Jichang, et autres
Publié: (2024) -
Inter-Domain Mixup for Semi-Supervised Domain Adaptation
par: Li, Jichang, et autres
Publié: (2024)