DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiong, Zhitong, Wang, Yi, Yu, Weikang, Stewart, Adam J, Zhao, Jie, Lehmann, Nils, Dujardin, Thomas, Yuan, Zhenghang, Ghamisi, Pedram, Zhu, Xiao Xiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
por: Yuan, Zhenghang, et al.
Publicado: (2024)
por: Yuan, Zhenghang, et al.
Publicado: (2024)
On the Foundations of Earth and Climate Foundation Models
por: Zhu, Xiao Xiang, et al.
Publicado: (2024)
por: Zhu, Xiao Xiang, et al.
Publicado: (2024)
Panopticon: Advancing Any-Sensor Foundation Models for Earth Observation
por: Waldmann, Leonard, et al.
Publicado: (2025)
por: Waldmann, Leonard, et al.
Publicado: (2025)
EO-VAE: Towards A Multi-sensor Tokenizer for Earth Observation Data
por: Lehmann, Nils, et al.
Publicado: (2026)
por: Lehmann, Nils, et al.
Publicado: (2026)
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
Neural Plasticity-Inspired Multimodal Foundation Model for Earth Observation
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
Towards a Unified Copernicus Foundation Model for Earth Vision
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding
por: Li, Zhenshi, et al.
Publicado: (2025)
por: Li, Zhenshi, et al.
Publicado: (2025)
EarthNets: Empowering AI in Earth Observation
por: Xiong, Zhitong, et al.
Publicado: (2022)
por: Xiong, Zhitong, et al.
Publicado: (2022)
ExEBench: Benchmarking Foundation Models on Extreme Earth Events
por: Zhao, Shan, et al.
Publicado: (2025)
por: Zhao, Shan, et al.
Publicado: (2025)
Universal Adversarial Defense in Remote Sensing Based on Pre-trained Denoising Diffusion Models
por: Yu, Weikang, et al.
Publicado: (2023)
por: Yu, Weikang, et al.
Publicado: (2023)
Change Captioning in Remote Sensing: Evolution to SAT-Cap -- A Single-Stage Transformer Approach
por: Wang, Yuduo, et al.
Publicado: (2025)
por: Wang, Yuduo, et al.
Publicado: (2025)
MaskCD: A Remote Sensing Change Detection Network Based on Mask Classification
por: Yu, Weikang, et al.
Publicado: (2024)
por: Yu, Weikang, et al.
Publicado: (2024)
MineNetCD: A Benchmark for Global Mining Change Detection on Remote Sensing Imagery
por: Yu, Weikang, et al.
Publicado: (2024)
por: Yu, Weikang, et al.
Publicado: (2024)
REOBench: Benchmarking Robustness of Earth Observation Foundation Models
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
por: Wang, Yuduo, et al.
Publicado: (2023)
por: Wang, Yuduo, et al.
Publicado: (2023)
ChangeMinds: Multi-task Framework for Detecting and Describing Changes in Remote Sensing
por: Wang, Yuduo, et al.
Publicado: (2024)
por: Wang, Yuduo, et al.
Publicado: (2024)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
por: Li, Xiang, et al.
Publicado: (2023)
por: Li, Xiang, et al.
Publicado: (2023)
Responsible AI for Earth Observation
por: Ghamisi, Pedram, et al.
Publicado: (2024)
por: Ghamisi, Pedram, et al.
Publicado: (2024)
Beyond Grid Data: Exploring Graph Neural Networks for Earth Observation
por: Zhao, Shan, et al.
Publicado: (2024)
por: Zhao, Shan, et al.
Publicado: (2024)
EuroMineNet: A Multitemporal Sentinel-2 Benchmark for Spatiotemporal Mining Footprint Analysis in the European Union (2015-2024)
por: Yu, Weikang, et al.
Publicado: (2025)
por: Yu, Weikang, et al.
Publicado: (2025)
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
por: Shu, Yan, et al.
Publicado: (2026)
por: Shu, Yan, et al.
Publicado: (2026)
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
por: Xue, Xizhe, et al.
Publicado: (2025)
por: Xue, Xizhe, et al.
Publicado: (2025)
Auto-Prompting SAM for Weakly Supervised Landslide Extraction
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
UrbanSARFloods: Sentinel-1 SLC-Based Benchmark Dataset for Urban and Open-Area Flood Mapping
por: Zhao, Jie, et al.
Publicado: (2024)
por: Zhao, Jie, et al.
Publicado: (2024)
FlexiMo: A Flexible Remote Sensing Foundation Model
por: Li, Xuyang, et al.
Publicado: (2025)
por: Li, Xuyang, et al.
Publicado: (2025)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
por: Zhan, Yang, et al.
Publicado: (2024)
por: Zhan, Yang, et al.
Publicado: (2024)
Geospatial Foundation Models to Enable Progress on Sustainable Development Goals
por: Ghamisi, Pedram, et al.
Publicado: (2025)
por: Ghamisi, Pedram, et al.
Publicado: (2025)
Advancing Earth Observation Through Machine Learning: A TorchGeo Tutorial
por: Robinson, Caleb, et al.
Publicado: (2026)
por: Robinson, Caleb, et al.
Publicado: (2026)
Survey of Multimodal Geospatial Foundation Models: Techniques, Applications, and Challenges
por: Yang, Liling, et al.
Publicado: (2025)
por: Yang, Liling, et al.
Publicado: (2025)
EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM
por: Shu, Yan, et al.
Publicado: (2025)
por: Shu, Yan, et al.
Publicado: (2025)
Multi-Target Unsupervised Domain Adaptation for Semantic Segmentation without External Data
por: Xu, Yonghao, et al.
Publicado: (2024)
por: Xu, Yonghao, et al.
Publicado: (2024)
Towards Realistic Remote Sensing Dataset Distillation with Discriminative Prototype-guided Diffusion
por: Xu, Yonghao, et al.
Publicado: (2026)
por: Xu, Yonghao, et al.
Publicado: (2026)
HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers
por: Rizaldy, Aldino, et al.
Publicado: (2025)
por: Rizaldy, Aldino, et al.
Publicado: (2025)
Efficient Subseasonal Weather Forecast using Teleconnection-informed Transformers
por: Zhao, Shan, et al.
Publicado: (2024)
por: Zhao, Shan, et al.
Publicado: (2024)
SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining
por: Braham, Nassim Ait Ali, et al.
Publicado: (2026)
por: Braham, Nassim Ait Ali, et al.
Publicado: (2026)
RRSIS: Referring Remote Sensing Image Segmentation
por: Yuan, Zhenghang, et al.
Publicado: (2023)
por: Yuan, Zhenghang, et al.
Publicado: (2023)
GlobalGeoTree: A Multi-Granular Vision-Language Dataset for Global Tree Species Classification
por: Mu, Yang, et al.
Publicado: (2025)
por: Mu, Yang, et al.
Publicado: (2025)
Multi-Label Guided Soft Contrastive Learning for Efficient Earth Observation Pretraining
por: Wang, Yi, et al.
Publicado: (2024)
por: Wang, Yi, et al.
Publicado: (2024)
Decoupling Common and Unique Representations for Multimodal Self-supervised Learning
por: Wang, Yi, et al.
Publicado: (2023)
por: Wang, Yi, et al.
Publicado: (2023)
Ejemplares similares
-
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
por: Yuan, Zhenghang, et al.
Publicado: (2024) -
On the Foundations of Earth and Climate Foundation Models
por: Zhu, Xiao Xiang, et al.
Publicado: (2024) -
Panopticon: Advancing Any-Sensor Foundation Models for Earth Observation
por: Waldmann, Leonard, et al.
Publicado: (2025) -
EO-VAE: Towards A Multi-sensor Tokenizer for Earth Observation Data
por: Lehmann, Nils, et al.
Publicado: (2026) -
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)