ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Zhenghang, Xiong, Zhitong, Mou, Lichao, Zhu, Xiao Xiang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EarthNets: Empowering AI in Earth Observation
by: Xiong, Zhitong, et al.
Published: (2022)
by: Xiong, Zhitong, et al.
Published: (2022)
RRSIS: Referring Remote Sensing Image Segmentation
by: Yuan, Zhenghang, et al.
Published: (2023)
by: Yuan, Zhenghang, et al.
Published: (2023)
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2025)
by: Xiong, Zhitong, et al.
Published: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
by: Xiong, Zhitong, et al.
Published: (2024)
by: Xiong, Zhitong, et al.
Published: (2024)
GlobalGeoTree: A Multi-Granular Vision-Language Dataset for Global Tree Species Classification
by: Mu, Yang, et al.
Published: (2025)
by: Mu, Yang, et al.
Published: (2025)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
by: Li, Xiang, et al.
Published: (2023)
by: Li, Xiang, et al.
Published: (2023)
Towards a Unified Copernicus Foundation Model for Earth Vision
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
REOBench: Benchmarking Robustness of Earth Observation Foundation Models
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
by: Zhan, Yang, et al.
Published: (2024)
by: Zhan, Yang, et al.
Published: (2024)
UrbanSARFloods: Sentinel-1 SLC-Based Benchmark Dataset for Urban and Open-Area Flood Mapping
by: Zhao, Jie, et al.
Published: (2024)
by: Zhao, Jie, et al.
Published: (2024)
Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model
by: Liu, Chenyang, et al.
Published: (2025)
by: Liu, Chenyang, et al.
Published: (2025)
Scale-Aware Contrastive Reverse Distillation for Unsupervised Medical Anomaly Detection
by: Li, Chunlei, et al.
Published: (2025)
by: Li, Chunlei, et al.
Published: (2025)
BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation
by: Herzog, Johann-Ludwig, et al.
Published: (2026)
by: Herzog, Johann-Ludwig, et al.
Published: (2026)
High-Order Progressive Trajectory Matching for Medical Image Dataset Distillation
by: Dong, Le, et al.
Published: (2025)
by: Dong, Le, et al.
Published: (2025)
Neural Plasticity-Inspired Multimodal Foundation Model for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2024)
by: Xiong, Zhitong, et al.
Published: (2024)
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
by: Shu, Yan, et al.
Published: (2026)
by: Shu, Yan, et al.
Published: (2026)
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
by: Xue, Xizhe, et al.
Published: (2025)
by: Xue, Xizhe, et al.
Published: (2025)
GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis
by: Zavras, Angelos, et al.
Published: (2025)
by: Zavras, Angelos, et al.
Published: (2025)
EO-VAE: Towards A Multi-sensor Tokenizer for Earth Observation Data
by: Lehmann, Nils, et al.
Published: (2026)
by: Lehmann, Nils, et al.
Published: (2026)
CausalCLIPSeg: Unlocking CLIP's Potential in Referring Medical Image Segmentation with Causal Intervention
by: Chen, Yaxiong, et al.
Published: (2025)
by: Chen, Yaxiong, et al.
Published: (2025)
ProPL: Universal Semi-Supervised Ultrasound Image Segmentation via Prompt-Guided Pseudo-Labeling
by: Chen, Yaxiong, et al.
Published: (2025)
by: Chen, Yaxiong, et al.
Published: (2025)
Multimodal Large Language Models for Medical Report Generation via Customized Prompt Tuning
by: Li, Chunlei, et al.
Published: (2025)
by: Li, Chunlei, et al.
Published: (2025)
Reducing Annotation Burden: Exploiting Image Knowledge for Few-Shot Medical Video Object Segmentation via Spatiotemporal Consistency Relearning
by: Zheng, Zixuan, et al.
Published: (2025)
by: Zheng, Zixuan, et al.
Published: (2025)
Beyond Grid Data: Exploring Graph Neural Networks for Earth Observation
by: Zhao, Shan, et al.
Published: (2024)
by: Zhao, Shan, et al.
Published: (2024)
Hierarchical Semi-Supervised Active Learning for Remote Sensing
by: Huang, Wei, et al.
Published: (2025)
by: Huang, Wei, et al.
Published: (2025)
SpectralEarth: Training Hyperspectral Foundation Models at Scale
by: Braham, Nassim Ait Ali, et al.
Published: (2024)
by: Braham, Nassim Ait Ali, et al.
Published: (2024)
SAM 3D for 3D Object Reconstruction from Remote Sensing Images
by: Yao, Junsheng, et al.
Published: (2025)
by: Yao, Junsheng, et al.
Published: (2025)
Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration
by: Dong, Guanglu, et al.
Published: (2026)
by: Dong, Guanglu, et al.
Published: (2026)
Striving for Simplicity: Simple Yet Effective Prior-Aware Pseudo-Labeling for Semi-Supervised Ultrasound Image Segmentation
by: Chen, Yaxiong, et al.
Published: (2025)
by: Chen, Yaxiong, et al.
Published: (2025)
MetaEarth: A Generative Foundation Model for Global-Scale Remote Sensing Image Generation
by: Yu, Zhiping, et al.
Published: (2024)
by: Yu, Zhiping, et al.
Published: (2024)
LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases
by: Quoc, Khang Nguyen, et al.
Published: (2026)
by: Quoc, Khang Nguyen, et al.
Published: (2026)
Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt Rewriting
by: Chen, Zijie, et al.
Published: (2023)
by: Chen, Zijie, et al.
Published: (2023)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
by: Chi, Xiaowei, et al.
Published: (2023)
by: Chi, Xiaowei, et al.
Published: (2023)
Rethinking Cell Counting Methods: Decoupling Counting and Localization
by: Zheng, Zixuan, et al.
Published: (2025)
by: Zheng, Zixuan, et al.
Published: (2025)
PolyGNN: Polyhedron-based Graph Neural Network for 3D Building Reconstruction from Point Clouds
by: Chen, Zhaiyu, et al.
Published: (2023)
by: Chen, Zhaiyu, et al.
Published: (2023)
HED-UNet: Combined Segmentation and Edge Detection for Monitoring the Antarctic Coastline
by: Heidler, Konrad, et al.
Published: (2021)
by: Heidler, Konrad, et al.
Published: (2021)
UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation
by: Chen, Yaxiong, et al.
Published: (2025)
by: Chen, Yaxiong, et al.
Published: (2025)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
by: Jin, Peng, et al.
Published: (2023)
by: Jin, Peng, et al.
Published: (2023)
Ultrasound Image-to-Video Synthesis via Latent Dynamic Diffusion Models
by: Chen, Tingxiu, et al.
Published: (2025)
by: Chen, Tingxiu, et al.
Published: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
by: Zheng, Kaipeng, et al.
Published: (2023)
by: Zheng, Kaipeng, et al.
Published: (2023)
Similar Items
-
EarthNets: Empowering AI in Earth Observation
by: Xiong, Zhitong, et al.
Published: (2022) -
RRSIS: Referring Remote Sensing Image Segmentation
by: Yuan, Zhenghang, et al.
Published: (2023) -
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2025) -
One for All: Toward Unified Foundation Models for Earth Vision
by: Xiong, Zhitong, et al.
Published: (2024) -
GlobalGeoTree: A Multi-Granular Vision-Language Dataset for Global Tree Species Classification
by: Mu, Yang, et al.
Published: (2025)