EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Wei, Cai, Miaoxin, Ning, Yaqian, Zhang, Tong, Zhuang, Yin, Lu, Shijian, Chen, He, Li, Jun, Mao, Xuerui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
por: Guo, Xin, et al.
Publicado: (2023)
por: Guo, Xin, et al.
Publicado: (2023)
UniDet-D: A Unified Dynamic Spectral Attention Model for Object Detection under Adverse Weathers
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
RS-TinyNet: Stage-wise Feature Fusion Network for Detecting Tiny Objects in Remote Sensing Images
por: Jiang, Xiaozheng, et al.
Publicado: (2025)
por: Jiang, Xiaozheng, et al.
Publicado: (2025)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
por: Guo, Haonan, et al.
Publicado: (2024)
por: Guo, Haonan, et al.
Publicado: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
SOPSeg: Prompt-based Small Object Instance Segmentation in Remote Sensing Imagery
por: Wang, Chenhao, et al.
Publicado: (2025)
por: Wang, Chenhao, et al.
Publicado: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
MKSNet: Advanced Small Object Detection in Remote Sensing Imagery with Multi-Kernel and Dual Attention Mechanisms
por: Zhang, Jiahao, et al.
Publicado: (2025)
por: Zhang, Jiahao, et al.
Publicado: (2025)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
por: Zi, Xing, et al.
Publicado: (2025)
por: Zi, Xing, et al.
Publicado: (2025)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
por: He, Shuwei, et al.
Publicado: (2024)
por: He, Shuwei, et al.
Publicado: (2024)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
por: Xu, Zelin, et al.
Publicado: (2026)
por: Xu, Zelin, et al.
Publicado: (2026)
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
por: Wu, Diankun, et al.
Publicado: (2025)
por: Wu, Diankun, et al.
Publicado: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
por: Zhang, Zilun, et al.
Publicado: (2024)
por: Zhang, Zilun, et al.
Publicado: (2024)
Data-driven transient growth analysis
por: Wang, Yin, et al.
Publicado: (2025)
por: Wang, Yin, et al.
Publicado: (2025)
GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery
por: Jiang, Lifan, et al.
Publicado: (2026)
por: Jiang, Lifan, et al.
Publicado: (2026)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
ESC-MISR: Enhancing Spatial Correlations for Multi-Image Super-Resolution in Remote Sensing
por: Zhang, Zhihui, et al.
Publicado: (2024)
por: Zhang, Zhihui, et al.
Publicado: (2024)
SatelliteFormula: Multi-Modal Symbolic Regression from Remote Sensing Imagery for Physics Discovery
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
SatFusion: A Unified Framework for Enhancing Remote Sensing Images via Multi-Frame and Multi-Source Images Fusion
por: Tong, Yufei, et al.
Publicado: (2025)
por: Tong, Yufei, et al.
Publicado: (2025)
Referring Change Detection in Remote Sensing Imagery
por: Korkmaz, Yilmaz, et al.
Publicado: (2025)
por: Korkmaz, Yilmaz, et al.
Publicado: (2025)
Visual Position Prompt for MLLM based Visual Grounding
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
por: Shao, Run, et al.
Publicado: (2024)
por: Shao, Run, et al.
Publicado: (2024)
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
por: Wang, Ziyi, et al.
Publicado: (2026)
por: Wang, Ziyi, et al.
Publicado: (2026)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
por: Wen, Congcong, et al.
Publicado: (2025)
por: Wen, Congcong, et al.
Publicado: (2025)
Learning a Cross-modality Anomaly Detector for Remote Sensing Imagery
por: Li, Jingtao, et al.
Publicado: (2023)
por: Li, Jingtao, et al.
Publicado: (2023)
Sparse Focus Network for Multi-Source Remote Sensing Data Classification
por: Jin, Xuepeng, et al.
Publicado: (2024)
por: Jin, Xuepeng, et al.
Publicado: (2024)
Spatial Preference Rewarding for MLLMs Spatial Understanding
por: Qiu, Han, et al.
Publicado: (2025)
por: Qiu, Han, et al.
Publicado: (2025)
Diffusion Enhancement for Cloud Removal in Ultra-Resolution Remote Sensing Imagery
por: Sui, Jialu, et al.
Publicado: (2024)
por: Sui, Jialu, et al.
Publicado: (2024)
DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models
por: Chen, Keyan, et al.
Publicado: (2025)
por: Chen, Keyan, et al.
Publicado: (2025)
A Multi-scale Generalized Shrinkage Threshold Network for Image Blind Deblurring in Remote Sensing
por: Feng, Yujie, et al.
Publicado: (2023)
por: Feng, Yujie, et al.
Publicado: (2023)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
por: Yin, Xingyilang, et al.
Publicado: (2026)
por: Yin, Xingyilang, et al.
Publicado: (2026)
HDMba: Hyperspectral Remote Sensing Imagery Dehazing with State Space Model
por: Fu, Hang, et al.
Publicado: (2024)
por: Fu, Hang, et al.
Publicado: (2024)
Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing
por: Zhang, Weiyu, et al.
Publicado: (2026)
por: Zhang, Weiyu, et al.
Publicado: (2026)
Ejemplares similares
-
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
por: Zhang, Wei, et al.
Publicado: (2024) -
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
por: Zhang, Wei, et al.
Publicado: (2024) -
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
por: Zhang, Wei, et al.
Publicado: (2024) -
SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
por: Guo, Xin, et al.
Publicado: (2023) -
UniDet-D: A Unified Dynamic Spectral Attention Model for Object Detection under Adverse Weathers
por: Zhang, Wei, et al.
Publicado: (2025)