ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Ke, Wang, Ting, Wang, Di, Zhu, Yongshan, Zhang, Yiming, Lei, Tao, Wang, Quan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
por: Li, Ke, et al.
Publicado: (2025)
por: Li, Ke, et al.
Publicado: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection
por: Li, Ke, et al.
Publicado: (2024)
por: Li, Ke, et al.
Publicado: (2024)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
por: Shi, Liangtao, et al.
Publicado: (2025)
por: Shi, Liangtao, et al.
Publicado: (2025)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2023)
por: Xiao, Linhui, et al.
Publicado: (2023)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
por: Dai, Ming, et al.
Publicado: (2024)
por: Dai, Ming, et al.
Publicado: (2024)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
por: Zhang, Peirong, et al.
Publicado: (2025)
por: Zhang, Peirong, et al.
Publicado: (2025)
LLM4VG: Large Language Models Evaluation for Video Grounding
por: Feng, Wei, et al.
Publicado: (2023)
por: Feng, Wei, et al.
Publicado: (2023)
Phrase Decoupling Cross-Modal Hierarchical Matching and Progressive Position Correction for Visual Grounding
por: Xie, Minghong, et al.
Publicado: (2024)
por: Xie, Minghong, et al.
Publicado: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
por: Zheng, Shurong, et al.
Publicado: (2026)
por: Zheng, Shurong, et al.
Publicado: (2026)
A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping
por: Gao, Peng, et al.
Publicado: (2025)
por: Gao, Peng, et al.
Publicado: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
por: Bai, Sule, et al.
Publicado: (2025)
por: Bai, Sule, et al.
Publicado: (2025)
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
SOPSeg: Prompt-based Small Object Instance Segmentation in Remote Sensing Imagery
por: Wang, Chenhao, et al.
Publicado: (2025)
por: Wang, Chenhao, et al.
Publicado: (2025)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
por: Liu, Junli, et al.
Publicado: (2025)
por: Liu, Junli, et al.
Publicado: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
por: Kang, Weitai, et al.
Publicado: (2024)
por: Kang, Weitai, et al.
Publicado: (2024)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
por: Zhong, Chunlin, et al.
Publicado: (2025)
por: Zhong, Chunlin, et al.
Publicado: (2025)
Leveraging Fine-Grained Information and Noise Decoupling for Remote Sensing Change Detection
por: Du, Qiangang, et al.
Publicado: (2024)
por: Du, Qiangang, et al.
Publicado: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
Remote Sensing Image Classification with Decoupled Knowledge Distillation
por: He, Yaping, et al.
Publicado: (2025)
por: He, Yaping, et al.
Publicado: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
VG3T: Visual Geometry Grounded Gaussian Transformer
por: Kim, Junho, et al.
Publicado: (2025)
por: Kim, Junho, et al.
Publicado: (2025)
Rethinking Scanning Strategies with Vision Mamba in Semantic Segmentation of Remote Sensing Imagery: An Experimental Study
por: Zhu, Qinfeng, et al.
Publicado: (2024)
por: Zhu, Qinfeng, et al.
Publicado: (2024)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
por: Zhao, Yibin, et al.
Publicado: (2026)
por: Zhao, Yibin, et al.
Publicado: (2026)
HyperFree: A Channel-adaptive and Tuning-free Foundation Model for Hyperspectral Remote Sensing Imagery
por: Li, Jingtao, et al.
Publicado: (2025)
por: Li, Jingtao, et al.
Publicado: (2025)
XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?
por: Wang, Fengxiang, et al.
Publicado: (2025)
por: Wang, Fengxiang, et al.
Publicado: (2025)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
por: Yan, Xiaoyang, et al.
Publicado: (2026)
por: Yan, Xiaoyang, et al.
Publicado: (2026)
Referring Change Detection in Remote Sensing Imagery
por: Korkmaz, Yilmaz, et al.
Publicado: (2025)
por: Korkmaz, Yilmaz, et al.
Publicado: (2025)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
por: Dong, Fuyu, et al.
Publicado: (2025)
por: Dong, Fuyu, et al.
Publicado: (2025)
Robust Drone-View Geo-Localization via Content-Viewpoint Disentanglement
por: Li, Ke, et al.
Publicado: (2025)
por: Li, Ke, et al.
Publicado: (2025)
Spatial-Regularization-Aware Dual-Branch Collaborative Inference for Training-Free OVSS in Remote Sensing Imagery
por: Wang, Jianzheng, et al.
Publicado: (2026)
por: Wang, Jianzheng, et al.
Publicado: (2026)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
por: Wang, Jingchao, et al.
Publicado: (2025)
por: Wang, Jingchao, et al.
Publicado: (2025)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
por: Zheng, Minghang, et al.
Publicado: (2024)
por: Zheng, Minghang, et al.
Publicado: (2024)
Learning De-Biased Representations for Remote-Sensing Imagery
por: Tian, Zichen, et al.
Publicado: (2024)
por: Tian, Zichen, et al.
Publicado: (2024)
DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery
por: Sethi, Geet, et al.
Publicado: (2026)
por: Sethi, Geet, et al.
Publicado: (2026)
ISWSST: Index-space-wave State Superposition Transformers for Multispectral Remotely Sensed Imagery Semantic Segmentation
por: Li, Chang, et al.
Publicado: (2024)
por: Li, Chang, et al.
Publicado: (2024)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
Ejemplares similares
-
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
por: Li, Ke, et al.
Publicado: (2025) -
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026) -
Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection
por: Li, Ke, et al.
Publicado: (2024) -
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024) -
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
por: Shi, Liangtao, et al.
Publicado: (2025)