AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Junli, Chen, Qizhi, Wang, Zhigang, Tang, Yiwen, Zhang, Yiting, Yan, Chi, Wang, Dong, Li, Xuelong, Zhao, Bin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring the Potential of Encoder-free Architectures in 3D LMMs
by: Tang, Yiwen, et al.
Published: (2025)
by: Tang, Yiwen, et al.
Published: (2025)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
by: Zhong, Chunlin, et al.
Published: (2025)
by: Zhong, Chunlin, et al.
Published: (2025)
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
by: Yan, Chi, et al.
Published: (2023)
by: Yan, Chi, et al.
Published: (2023)
NWPU-MOC: A Benchmark for Fine-grained Multi-category Object Counting in Aerial Images
by: Gao, Junyu, et al.
Published: (2024)
by: Gao, Junyu, et al.
Published: (2024)
Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection
by: Wei, Guoting, et al.
Published: (2026)
by: Wei, Guoting, et al.
Published: (2026)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
by: Xiao, Linhui, et al.
Published: (2023)
by: Xiao, Linhui, et al.
Published: (2023)
Griffin: Aerial-Ground Cooperative Detection and Tracking Dataset and Benchmark
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
by: Kang, Weitai, et al.
Published: (2024)
by: Kang, Weitai, et al.
Published: (2024)
FreeGaussian: Annotation-free Control of Articulated Objects via 3D Gaussian Splats with Flow Derivatives
by: Chen, Qizhi, et al.
Published: (2024)
by: Chen, Qizhi, et al.
Published: (2024)
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
by: Gao, Xianqiang, et al.
Published: (2026)
by: Gao, Xianqiang, et al.
Published: (2026)
RefAerial: A Benchmark and Approach for Referring Detection in Aerial Images
by: Hu, Guyue, et al.
Published: (2026)
by: Hu, Guyue, et al.
Published: (2026)
Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained Models
by: Tang, Yiwen, et al.
Published: (2023)
by: Tang, Yiwen, et al.
Published: (2023)
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
by: Zhang, Pingrui, et al.
Published: (2025)
by: Zhang, Pingrui, et al.
Published: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
by: Xiao, Linhui, et al.
Published: (2024)
by: Xiao, Linhui, et al.
Published: (2024)
AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis
by: Vuong, Khiem, et al.
Published: (2025)
by: Vuong, Khiem, et al.
Published: (2025)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
by: Zheng, Minghang, et al.
Published: (2024)
by: Zheng, Minghang, et al.
Published: (2024)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
by: Li, Ke, et al.
Published: (2026)
by: Li, Ke, et al.
Published: (2026)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
by: Bai, Sule, et al.
Published: (2025)
by: Bai, Sule, et al.
Published: (2025)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
by: Yan, Xiaoyang, et al.
Published: (2026)
by: Yan, Xiaoyang, et al.
Published: (2026)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
by: Zheng, Shurong, et al.
Published: (2026)
by: Zheng, Shurong, et al.
Published: (2026)
Zero-Shot Aerial Object Detection with Visual Description Regularization
by: Zang, Zhengqing, et al.
Published: (2024)
by: Zang, Zhengqing, et al.
Published: (2024)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
by: Lim, Byeonggeuk, et al.
Published: (2026)
by: Lim, Byeonggeuk, et al.
Published: (2026)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
by: Li, Haocheng, et al.
Published: (2026)
by: Li, Haocheng, et al.
Published: (2026)
Dynamic Token Selection for Aerial-Ground Person Re-Identification
by: Wang, Yuhai, et al.
Published: (2024)
by: Wang, Yuhai, et al.
Published: (2024)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
by: Yao, Yuanqi, et al.
Published: (2025)
by: Yao, Yuanqi, et al.
Published: (2025)
Text-based Aerial-Ground Person Retrieval
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
Skyeyes: Ground Roaming using Aerial View Images
by: Gao, Zhiyuan, et al.
Published: (2024)
by: Gao, Zhiyuan, et al.
Published: (2024)
MODA: The First Challenging Benchmark for Multispectral Object Detection in Aerial Images
by: Han, Shuaihao, et al.
Published: (2025)
by: Han, Shuaihao, et al.
Published: (2025)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
by: Zhao, Yibin, et al.
Published: (2026)
by: Zhao, Yibin, et al.
Published: (2026)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
by: Shi, Liangtao, et al.
Published: (2025)
by: Shi, Liangtao, et al.
Published: (2025)
AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-Identification
by: Nguyen, Huy, et al.
Published: (2025)
by: Nguyen, Huy, et al.
Published: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
by: Tong, Haoyu, et al.
Published: (2026)
by: Tong, Haoyu, et al.
Published: (2026)
VG3T: Visual Geometry Grounded Gaussian Transformer
by: Kim, Junho, et al.
Published: (2025)
by: Kim, Junho, et al.
Published: (2025)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
by: Wang, Zhigang, et al.
Published: (2024)
by: Wang, Zhigang, et al.
Published: (2024)
Night-to-Day Translation via Illumination Degradation Disentanglement
by: Lan, Guanzhou, et al.
Published: (2024)
by: Lan, Guanzhou, et al.
Published: (2024)
Enhancing Ground-to-Aerial Image Matching for Visual Misinformation Detection Using Semantic Segmentation
by: Mule, Emanuele, et al.
Published: (2025)
by: Mule, Emanuele, et al.
Published: (2025)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
by: Wang, Yuji, et al.
Published: (2025)
by: Wang, Yuji, et al.
Published: (2025)
Exploring the Impact of Synthetic Data for Aerial-view Human Detection
by: Lee, Hyungtae, et al.
Published: (2024)
by: Lee, Hyungtae, et al.
Published: (2024)
Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis
by: Ye, Junyan, et al.
Published: (2024)
by: Ye, Junyan, et al.
Published: (2024)
Vision-Based Anti Unmanned Aerial Technology: Opportunities and Challenges
by: Ding, Guanghai, et al.
Published: (2025)
by: Ding, Guanghai, et al.
Published: (2025)
Similar Items
-
Exploring the Potential of Encoder-free Architectures in 3D LMMs
by: Tang, Yiwen, et al.
Published: (2025) -
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
by: Zhong, Chunlin, et al.
Published: (2025) -
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
by: Yan, Chi, et al.
Published: (2023) -
NWPU-MOC: A Benchmark for Fine-grained Multi-category Object Counting in Aerial Images
by: Gao, Junyu, et al.
Published: (2024) -
Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection
by: Wei, Guoting, et al.
Published: (2026)