EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Wei, Cai, Miaoxin, Zhang, Tong, Li, Jun, Zhuang, Yin, Mao, Xuerui |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
RS-TinyNet: Stage-wise Feature Fusion Network for Detecting Tiny Objects in Remote Sensing Images
by: Jiang, Xiaozheng, et al.
Published: (2025)
by: Jiang, Xiaozheng, et al.
Published: (2025)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
UniDet-D: A Unified Dynamic Spectral Attention Model for Object Detection under Adverse Weathers
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
by: Guo, Pinxue, et al.
Published: (2024)
by: Guo, Pinxue, et al.
Published: (2024)
SkySense V2: A Unified Foundation Model for Multi-modal Remote Sensing
by: Zhang, Yingying, et al.
Published: (2025)
by: Zhang, Yingying, et al.
Published: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
M$^3$amba: CLIP-driven Mamba Model for Multi-modal Remote Sensing Classification
by: Cao, Mingxiang, et al.
Published: (2025)
by: Cao, Mingxiang, et al.
Published: (2025)
MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning
by: Wang, Tong, et al.
Published: (2025)
by: Wang, Tong, et al.
Published: (2025)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
by: Jiang, Dongsheng, et al.
Published: (2023)
by: Jiang, Dongsheng, et al.
Published: (2023)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints
by: Ahmad, Wasim, et al.
Published: (2026)
by: Ahmad, Wasim, et al.
Published: (2026)
SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
by: Ma, Shuailei, et al.
Published: (2023)
by: Ma, Shuailei, et al.
Published: (2023)
RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation
by: Min, Rui, et al.
Published: (2026)
by: Min, Rui, et al.
Published: (2026)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
by: Guo, Haonan, et al.
Published: (2024)
by: Guo, Haonan, et al.
Published: (2024)
BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model
by: Li, Yujie, et al.
Published: (2025)
by: Li, Yujie, et al.
Published: (2025)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
by: Wei, Cong, et al.
Published: (2024)
by: Wei, Cong, et al.
Published: (2024)
GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing
by: Ou, Ruizhe, et al.
Published: (2025)
by: Ou, Ruizhe, et al.
Published: (2025)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
by: An, Xiao, et al.
Published: (2024)
by: An, Xiao, et al.
Published: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
by: Zhang, Zilun, et al.
Published: (2025)
by: Zhang, Zilun, et al.
Published: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
by: Siripong, Surasakdi, et al.
Published: (2024)
by: Siripong, Surasakdi, et al.
Published: (2024)
Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images
by: Miao, Shiyu, et al.
Published: (2024)
by: Miao, Shiyu, et al.
Published: (2024)
STARS: Shared-specific Translation and Alignment for missing-modality Remote Sensing Semantic Segmentation
by: Wang, Tong, et al.
Published: (2026)
by: Wang, Tong, et al.
Published: (2026)
GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis
by: Zavras, Angelos, et al.
Published: (2025)
by: Zavras, Angelos, et al.
Published: (2025)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
by: Yang, Shijun, et al.
Published: (2025)
by: Yang, Shijun, et al.
Published: (2025)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
by: Gong, Ziyang, et al.
Published: (2024)
by: Gong, Ziyang, et al.
Published: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
by: Chen, Haokun, et al.
Published: (2025)
by: Chen, Haokun, et al.
Published: (2025)
Foundation Models for Remote Sensing and Earth Observation: A Survey
by: Xiao, Aoran, et al.
Published: (2024)
by: Xiao, Aoran, et al.
Published: (2024)
Efficient Multi-modal Large Language Models via Visual Token Grouping
by: Huang, Minbin, et al.
Published: (2024)
by: Huang, Minbin, et al.
Published: (2024)
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
by: Zi, Xing, et al.
Published: (2025)
by: Zi, Xing, et al.
Published: (2025)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
by: Wang, Puyi, et al.
Published: (2024)
by: Wang, Puyi, et al.
Published: (2024)
SMART-Ship: A Comprehensive Synchronized Multi-modal Aligned Remote Sensing Targets Dataset and Benchmark for Berthed Ships Analysis
by: Fan, Chen-Chen, et al.
Published: (2025)
by: Fan, Chen-Chen, et al.
Published: (2025)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
by: Zhang, Peirong, et al.
Published: (2025)
by: Zhang, Peirong, et al.
Published: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
by: Zhong, Chen, et al.
Published: (2026)
by: Zhong, Chen, et al.
Published: (2026)
SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images
by: Xin, Zepeng, et al.
Published: (2025)
by: Xin, Zepeng, et al.
Published: (2025)
EarthView: A Large Scale Remote Sensing Dataset for Self-Supervision
by: Velazquez, Diego, et al.
Published: (2025)
by: Velazquez, Diego, et al.
Published: (2025)
Similar Items
-
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
by: Zhang, Wei, et al.
Published: (2024) -
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
by: Zhang, Wei, et al.
Published: (2024) -
EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
by: Zhang, Wei, et al.
Published: (2025) -
RS-TinyNet: Stage-wise Feature Fusion Network for Detecting Tiny Objects in Remote Sensing Images
by: Jiang, Xiaozheng, et al.
Published: (2025) -
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
by: Zhang, Xu, et al.
Published: (2025)