SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Wen, Huang, Kangyao, Wang, Li, Xu, Wang, Fan, Wei, Liu, Jinyuan, Liu, Shaoyu, Liang, Hanfang, Duan, Hongwei, Xu, Bin, Ji, Xiangyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
por: Jiang, Wen, et al.
Publicado: (2025)
por: Jiang, Wen, et al.
Publicado: (2025)
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
por: Liu, Xu, et al.
Publicado: (2025)
por: Liu, Xu, et al.
Publicado: (2025)
Towards Task-Oriented Flying: Framework, Infrastructure, and Principles
por: Huang, Kangyao, et al.
Publicado: (2025)
por: Huang, Kangyao, et al.
Publicado: (2025)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
por: Yang, Jiahao, et al.
Publicado: (2026)
por: Yang, Jiahao, et al.
Publicado: (2026)
Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning
por: Zou, Heming, et al.
Publicado: (2025)
por: Zou, Heming, et al.
Publicado: (2025)
Volumetric Environment Representation for Vision-Language Navigation
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
FLAME: Learning to Navigate with Multimodal LLM in Urban Environments
por: Xu, Yunzhe, et al.
Publicado: (2024)
por: Xu, Yunzhe, et al.
Publicado: (2024)
CompetEvo: Towards Morphological Evolution from Competition
por: Huang, Kangyao, et al.
Publicado: (2024)
por: Huang, Kangyao, et al.
Publicado: (2024)
Stimulate the Potential of Robots via Competition
por: Huang, Kangyao, et al.
Publicado: (2024)
por: Huang, Kangyao, et al.
Publicado: (2024)
AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
por: Sun, Xiaolou, et al.
Publicado: (2026)
por: Sun, Xiaolou, et al.
Publicado: (2026)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
por: Liu, Youzhi, et al.
Publicado: (2024)
por: Liu, Youzhi, et al.
Publicado: (2024)
EventFlash: Towards Efficient MLLMs for Event-Based Vision
por: Liu, Shaoyu, et al.
Publicado: (2026)
por: Liu, Shaoyu, et al.
Publicado: (2026)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
por: Gao, Yunpeng, et al.
Publicado: (2024)
por: Gao, Yunpeng, et al.
Publicado: (2024)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
por: Wu, Wentao, et al.
Publicado: (2025)
por: Wu, Wentao, et al.
Publicado: (2025)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
por: Wu, Ruipu, et al.
Publicado: (2025)
por: Wu, Ruipu, et al.
Publicado: (2025)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
por: Zhou, Jiaxu, et al.
Publicado: (2026)
por: Zhou, Jiaxu, et al.
Publicado: (2026)
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
por: Liu, Kejia, et al.
Publicado: (2026)
por: Liu, Kejia, et al.
Publicado: (2026)
Vision-Based Autonomous UAV Navigation and Landing for Urban Search and Rescue
por: Mittal, Mayank, et al.
Publicado: (2019)
por: Mittal, Mayank, et al.
Publicado: (2019)
UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning
por: Wang, Xiangyu, et al.
Publicado: (2025)
por: Wang, Xiangyu, et al.
Publicado: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
por: Li, Fuhao, et al.
Publicado: (2025)
por: Li, Fuhao, et al.
Publicado: (2025)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
por: Liu, Shaoyu, et al.
Publicado: (2025)
por: Liu, Shaoyu, et al.
Publicado: (2025)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
por: Xu, Huilin, et al.
Publicado: (2025)
por: Xu, Huilin, et al.
Publicado: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
AdaptFly: Prompt-Guided Adaptation of Foundation Models for Low-Altitude UAV Networks
por: Chen, Jiao, et al.
Publicado: (2025)
por: Chen, Jiao, et al.
Publicado: (2025)
Experiences of middle‐aged individuals with lower extremity amputation caused by diabetic foot ulcer after disability in China: A qualitative study
por: Ziwei Xu, et al.
Publicado: (2024)
por: Ziwei Xu, et al.
Publicado: (2024)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
por: Xu, Haotian, et al.
Publicado: (2026)
por: Xu, Haotian, et al.
Publicado: (2026)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
por: Fan, Zehua, et al.
Publicado: (2026)
por: Fan, Zehua, et al.
Publicado: (2026)
How Secure Are Large Language Models (LLMs) for Navigation in Urban Environments?
por: Wen, Congcong, et al.
Publicado: (2024)
por: Wen, Congcong, et al.
Publicado: (2024)
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
por: Wang, Xiangyu, et al.
Publicado: (2024)
por: Wang, Xiangyu, et al.
Publicado: (2024)
Learning Occlusion-Robust Vision Transformers for Real-Time UAV Tracking
por: Wu, You, et al.
Publicado: (2025)
por: Wu, You, et al.
Publicado: (2025)
FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
por: Zou, Heming, et al.
Publicado: (2025)
por: Zou, Heming, et al.
Publicado: (2025)
Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
por: Xu, Yunzhe, et al.
Publicado: (2025)
por: Xu, Yunzhe, et al.
Publicado: (2025)
Comparative Analysis of UAV Path Planning Algorithms for Efficient Navigation in Urban 3D Environments
por: Cheriet, Hichem, et al.
Publicado: (2025)
por: Cheriet, Hichem, et al.
Publicado: (2025)
Unsupervised UAV 3D Trajectories Estimation with Sparse Point Clouds
por: Liang, Hanfang, et al.
Publicado: (2024)
por: Liang, Hanfang, et al.
Publicado: (2024)
Ejemplares similares
-
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
por: Jiang, Wen, et al.
Publicado: (2025) -
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
por: Liu, Xu, et al.
Publicado: (2025) -
Towards Task-Oriented Flying: Framework, Infrastructure, and Principles
por: Huang, Kangyao, et al.
Publicado: (2025) -
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
por: Yang, Jiahao, et al.
Publicado: (2026) -
Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning
por: Zou, Heming, et al.
Publicado: (2025)