TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing
Fuente:
arXiv
Saved in:
| Main Authors: | Jain, Pallavi, Marcos, Diego, Ienco, Dino, Interdonato, Roberto, Berchoux, Tristan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting
by: Jain, Pallavi, et al.
Published: (2024)
by: Jain, Pallavi, et al.
Published: (2024)
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
by: Aniraj, Ananthu, et al.
Published: (2025)
by: Aniraj, Ananthu, et al.
Published: (2025)
Multi-modal Co-learning for Earth Observation: Enhancing single-modality models via modality collaboration
by: Mena, Francisco, et al.
Published: (2025)
by: Mena, Francisco, et al.
Published: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
by: Liu, Fan, et al.
Published: (2023)
by: Liu, Fan, et al.
Published: (2023)
PDiscoFormer: Relaxing Part Discovery Constraints with Vision Transformers
by: Aniraj, Ananthu, et al.
Published: (2024)
by: Aniraj, Ananthu, et al.
Published: (2024)
Metonymy in vision models undermines attention-based interpretability
by: Aniraj, Ananthu, et al.
Published: (2026)
by: Aniraj, Ananthu, et al.
Published: (2026)
DisCoM-KD: Cross-Modal Knowledge Distillation via Disentanglement Representation and Adversarial Learning
by: Ienco, Dino, et al.
Published: (2024)
by: Ienco, Dino, et al.
Published: (2024)
Towards a multimodal framework for remote sensing image change retrieval and captioning
by: Ferrod, Roger, et al.
Published: (2024)
by: Ferrod, Roger, et al.
Published: (2024)
Atomizer: Generalizing to new modalities by breaking satellite images down to a set of scalars
by: de Turckheim, Hugo Riffaud, et al.
Published: (2025)
by: de Turckheim, Hugo Riffaud, et al.
Published: (2025)
Revisiting Cross-Modal Knowledge Distillation: A Disentanglement Approach for RGBD Semantic Segmentation
by: Ferrod, Roger, et al.
Published: (2025)
by: Ferrod, Roger, et al.
Published: (2025)
Resampling Augmentation for Time Series Contrastive Learning: Application to Remote Sensing
by: Saget, Antoine, et al.
Published: (2025)
by: Saget, Antoine, et al.
Published: (2025)
RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation
by: Houdré, Nicolas, et al.
Published: (2025)
by: Houdré, Nicolas, et al.
Published: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)
by: Pan, Jiancheng, et al.
Published: (2024)
Asynchronous Remote Sensing Time-Series Fusion for Cloud Removal and Anytime Reconstruction
by: Fallah, Forouzan, et al.
Published: (2026)
by: Fallah, Forouzan, et al.
Published: (2026)
Self-Supervised Cross-Modal Text-Image Time Series Retrieval in Remote Sensing
by: Hoxha, Genc, et al.
Published: (2025)
by: Hoxha, Genc, et al.
Published: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
by: Yang, Xiao, et al.
Published: (2026)
by: Yang, Xiao, et al.
Published: (2026)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
by: Weng, Xingxing, et al.
Published: (2025)
by: Weng, Xingxing, et al.
Published: (2025)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
by: Zhao, Shuai, et al.
Published: (2023)
by: Zhao, Shuai, et al.
Published: (2023)
Uncertainty-Guided Edge Learning for Deep Image Regression in Remote Sensing
by: Nguyen, Anh Vu, et al.
Published: (2026)
by: Nguyen, Anh Vu, et al.
Published: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
by: Chen, Weizhi, et al.
Published: (2025)
by: Chen, Weizhi, et al.
Published: (2025)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
by: Yao, Kelu, et al.
Published: (2025)
by: Yao, Kelu, et al.
Published: (2025)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
by: Liu, Chenyang, et al.
Published: (2024)
by: Liu, Chenyang, et al.
Published: (2024)
Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing
by: Adler, Mathis Jürgen, et al.
Published: (2025)
by: Adler, Mathis Jürgen, et al.
Published: (2025)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
by: An, Xiao, et al.
Published: (2024)
by: An, Xiao, et al.
Published: (2024)
Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models
by: Khoury, Karim El, et al.
Published: (2025)
by: Khoury, Karim El, et al.
Published: (2025)
MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP
by: Chaudhary, Aditya, et al.
Published: (2026)
by: Chaudhary, Aditya, et al.
Published: (2026)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
by: Li, Qingyun, et al.
Published: (2025)
by: Li, Qingyun, et al.
Published: (2025)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
by: Pang, Chao, et al.
Published: (2024)
by: Pang, Chao, et al.
Published: (2024)
Enhancing Remote Sensing Vision-Language Models for Zero-Shot Scene Classification
by: Khoury, Karim El, et al.
Published: (2024)
by: Khoury, Karim El, et al.
Published: (2024)
An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
by: Silva, João Daniel, et al.
Published: (2025)
by: Silva, João Daniel, et al.
Published: (2025)
Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations
by: Cha, Keumgang, et al.
Published: (2024)
by: Cha, Keumgang, et al.
Published: (2024)
M$^3$amba: CLIP-driven Mamba Model for Multi-modal Remote Sensing Classification
by: Cao, Mingxiang, et al.
Published: (2025)
by: Cao, Mingxiang, et al.
Published: (2025)
EcoWikiRS: Learning Ecological Representation of Satellite Images from Weak Supervision with Species Observations and Wikipedia
by: Zermatten, Valerie, et al.
Published: (2025)
by: Zermatten, Valerie, et al.
Published: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
by: Siripong, Surasakdi, et al.
Published: (2024)
by: Siripong, Surasakdi, et al.
Published: (2024)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
by: Silva, João Daniel, et al.
Published: (2024)
by: Silva, João Daniel, et al.
Published: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
by: Weng, Xingxing, et al.
Published: (2026)
by: Weng, Xingxing, et al.
Published: (2026)
SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
by: Si, Dongchen, et al.
Published: (2025)
by: Si, Dongchen, et al.
Published: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
by: Zhong, Siru, et al.
Published: (2025)
by: Zhong, Siru, et al.
Published: (2025)
Similar Items
-
SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting
by: Jain, Pallavi, et al.
Published: (2024) -
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
by: Aniraj, Ananthu, et al.
Published: (2025) -
Multi-modal Co-learning for Earth Observation: Enhancing single-modality models via modality collaboration
by: Mena, Francisco, et al.
Published: (2025) -
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
by: Liu, Fan, et al.
Published: (2023) -
PDiscoFormer: Relaxing Part Discovery Constraints with Vision Transformers
by: Aniraj, Ananthu, et al.
Published: (2024)