GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yue, Lan, Mengcheng, Li, Xiang, Feng, Litong, Ke, Yiping, Jiang, Xue, Li, Qingyun, Yang, Xue, Zhang, Wayne |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
por: Lan, Mengcheng, et al.
Publicado: (2024)
por: Lan, Mengcheng, et al.
Publicado: (2024)
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
por: Lan, Mengcheng, et al.
Publicado: (2024)
por: Lan, Mengcheng, et al.
Publicado: (2024)
Text4Seg: Reimagining Image Segmentation as Text Generation
por: Lan, Mengcheng, et al.
Publicado: (2024)
por: Lan, Mengcheng, et al.
Publicado: (2024)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
por: Zhou, Yue, et al.
Publicado: (2026)
por: Zhou, Yue, et al.
Publicado: (2026)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
por: Zhang, Peirong, et al.
Publicado: (2025)
por: Zhang, Peirong, et al.
Publicado: (2025)
Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models
por: Li, Zihan, et al.
Publicado: (2025)
por: Li, Zihan, et al.
Publicado: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
por: Li, Qingyun, et al.
Publicado: (2025)
por: Li, Qingyun, et al.
Publicado: (2025)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026)
por: Zhu, Jiashun, et al.
Publicado: (2026)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
NOCL: Node-Oriented Conceptualization LLM for Graph Tasks without Message Passing
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
por: Pang, Chao, et al.
Publicado: (2024)
por: Pang, Chao, et al.
Publicado: (2024)
Efficient Adaptation For Remote Sensing Visual Grounding
por: Moughnieh, Hasan, et al.
Publicado: (2025)
por: Moughnieh, Hasan, et al.
Publicado: (2025)
Directed Homophily-Aware Graph Neural Network
por: Zhang, Aihu, et al.
Publicado: (2025)
por: Zhang, Aihu, et al.
Publicado: (2025)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
por: Shabbir, Akashah, et al.
Publicado: (2025)
por: Shabbir, Akashah, et al.
Publicado: (2025)
Towards Unified Interactive Visual Grounding in The Wild
por: Xu, Jie, et al.
Publicado: (2024)
por: Xu, Jie, et al.
Publicado: (2024)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Towards Vision-Language Geo-Foundation Model: A Survey
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
por: Jia, Furong, et al.
Publicado: (2026)
por: Jia, Furong, et al.
Publicado: (2026)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
BrainPrompt: Multi-Level Brain Prompt Enhancement for Neurological Condition Identification
por: Xu, Jiaxing, et al.
Publicado: (2025)
por: Xu, Jiaxing, et al.
Publicado: (2025)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
por: Li, Yangfu, et al.
Publicado: (2026)
por: Li, Yangfu, et al.
Publicado: (2026)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
por: Zhao, Tianyi, et al.
Publicado: (2025)
por: Zhao, Tianyi, et al.
Publicado: (2025)
SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
por: Toker, Aysim, et al.
Publicado: (2025)
por: Toker, Aysim, et al.
Publicado: (2025)
GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing
por: Hasan, Maram, et al.
Publicado: (2026)
por: Hasan, Maram, et al.
Publicado: (2026)
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
por: Wang, Junxin, et al.
Publicado: (2026)
por: Wang, Junxin, et al.
Publicado: (2026)
Zero-Shot 3D Visual Grounding from Vision-Language Models
por: Li, Rong, et al.
Publicado: (2025)
por: Li, Rong, et al.
Publicado: (2025)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
por: Luo, Junwei, et al.
Publicado: (2025)
por: Luo, Junwei, et al.
Publicado: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
por: Li, Yuxuan, et al.
Publicado: (2026)
por: Li, Yuxuan, et al.
Publicado: (2026)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
por: Huang, Haifeng, et al.
Publicado: (2025)
por: Huang, Haifeng, et al.
Publicado: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
por: Li, Ke, et al.
Publicado: (2025)
por: Li, Ke, et al.
Publicado: (2025)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
por: Lan, Mengcheng, et al.
Publicado: (2025)
por: Lan, Mengcheng, et al.
Publicado: (2025)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
por: Li, Wenshuai, et al.
Publicado: (2026)
por: Li, Wenshuai, et al.
Publicado: (2026)
Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection
por: Li, Ke, et al.
Publicado: (2024)
por: Li, Ke, et al.
Publicado: (2024)
InstructSAM: A Training-Free Framework for Instruction-Oriented Remote Sensing Object Recognition
por: Zheng, Yijie, et al.
Publicado: (2025)
por: Zheng, Yijie, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
por: Zhou, Yue, et al.
Publicado: (2025) -
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
por: Lan, Mengcheng, et al.
Publicado: (2024) -
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
por: Lan, Mengcheng, et al.
Publicado: (2024) -
Text4Seg: Reimagining Image Segmentation as Text Generation
por: Lan, Mengcheng, et al.
Publicado: (2024) -
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
por: Zhou, Yue, et al.
Publicado: (2026)