An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Silva, João Daniel, Magalhaes, Joao, Tuia, Devis, Martins, Bruno |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2024)
par: Silva, João Daniel, et autres
Publié: (2024)
Large Language Models for Captioning and Retrieving Remote Sensing Images
par: Silva, João Daniel, et autres
Publié: (2024)
par: Silva, João Daniel, et autres
Publié: (2024)
SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing Images
par: Sumbul, Gencer, et autres
Publié: (2025)
par: Sumbul, Gencer, et autres
Publié: (2025)
Knowledge-aware Visual Question Generation for Remote Sensing Images
par: Li, Siran, et autres
Publié: (2026)
par: Li, Siran, et autres
Publié: (2026)
Knowledge-aware Text-Image Retrieval for Remote Sensing Images
par: Mi, Li, et autres
Publié: (2024)
par: Mi, Li, et autres
Publié: (2024)
Questions beyond Pixels: Integrating Commonsense Knowledge in Visual Question Generation for Remote Sensing
par: Li, Siran, et autres
Publié: (2026)
par: Li, Siran, et autres
Publié: (2026)
Multilingual Training-Free Remote Sensing Image Captioning
par: Rebelo, Carlos, et autres
Publié: (2025)
par: Rebelo, Carlos, et autres
Publié: (2025)
TRUST: Leveraging Text Robustness for Unsupervised Domain Adaptation
par: Litrico, Mattia, et autres
Publié: (2025)
par: Litrico, Mattia, et autres
Publié: (2025)
Cross-Modal Learning of Housing Quality in Amsterdam
par: Levering, Alex, et autres
Publié: (2024)
par: Levering, Alex, et autres
Publié: (2024)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
POLO -- Point-based, multi-class animal detection
par: May, Giacomo, et autres
Publié: (2024)
par: May, Giacomo, et autres
Publié: (2024)
Retrieval of Surface Solar Radiation through Implicit Albedo Recovery from Temporal Context
par: Frischholz, Yael, et autres
Publié: (2025)
par: Frischholz, Yael, et autres
Publié: (2025)
High-resolution Population Maps Derived from Sentinel-1 and Sentinel-2
par: Metzger, Nando, et autres
Publié: (2023)
par: Metzger, Nando, et autres
Publié: (2023)
Multi-Scale Grouped Prototypes for Interpretable Semantic Segmentation
par: Porta, Hugo, et autres
Publié: (2024)
par: Porta, Hugo, et autres
Publié: (2024)
CanadaFireSat: Toward high-resolution wildfire forecasting with multiple modalities
par: Porta, Hugo, et autres
Publié: (2025)
par: Porta, Hugo, et autres
Publié: (2025)
GeoExplorer: Active Geo-localization with Curiosity-Driven Exploration
par: Mi, Li, et autres
Publié: (2025)
par: Mi, Li, et autres
Publié: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
par: Liu, Fan, et autres
Publié: (2023)
par: Liu, Fan, et autres
Publié: (2023)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
par: Li, Yujie, et autres
Publié: (2024)
par: Li, Yujie, et autres
Publié: (2024)
EcoWikiRS: Learning Ecological Representation of Satellite Images from Weak Supervision with Species Observations and Wikipedia
par: Zermatten, Valerie, et autres
Publié: (2025)
par: Zermatten, Valerie, et autres
Publié: (2025)
MoralCLIP: Contrastive Alignment of Vision-and-Language Representations with Moral Foundations Theory
par: Condez, Ana Carolina, et autres
Publié: (2025)
par: Condez, Ana Carolina, et autres
Publié: (2025)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
par: Zhan, Yang, et autres
Publié: (2024)
par: Zhan, Yang, et autres
Publié: (2024)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
par: Weng, Xingxing, et autres
Publié: (2025)
par: Weng, Xingxing, et autres
Publié: (2025)
RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task
par: Li, Chunshan, et autres
Publié: (2025)
par: Li, Chunshan, et autres
Publié: (2025)
Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing
par: Adler, Mathis Jürgen, et autres
Publié: (2025)
par: Adler, Mathis Jürgen, et autres
Publié: (2025)
Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models
par: Khoury, Karim El, et autres
Publié: (2025)
par: Khoury, Karim El, et autres
Publié: (2025)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
par: An, Xiao, et autres
Publié: (2024)
par: An, Xiao, et autres
Publié: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
EoCD: Encoder only Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2026)
par: Noman, Mubashir, et autres
Publié: (2026)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
par: Guo, Haonan, et autres
Publié: (2024)
par: Guo, Haonan, et autres
Publié: (2024)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
par: Gong, Ziyang, et autres
Publié: (2024)
par: Gong, Ziyang, et autres
Publié: (2024)
SatelliteCalculator: A Multi-Task Vision Foundation Model for Quantitative Remote Sensing Inversion
par: Yu, Zhenyu, et autres
Publié: (2025)
par: Yu, Zhenyu, et autres
Publié: (2025)
Contributions to Label-Efficient Learning in Computer Vision and Remote Sensing
par: Pham, Minh-Tan
Publié: (2025)
par: Pham, Minh-Tan
Publié: (2025)
Checkmate: interpretable and explainable RSVQA is the endgame
par: Tosato, Lucrezia, et autres
Publié: (2025)
par: Tosato, Lucrezia, et autres
Publié: (2025)
GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing
par: Elgendy, Hosam, et autres
Publié: (2024)
par: Elgendy, Hosam, et autres
Publié: (2024)
From Classification to Segmentation with Explainable AI: A Study on Crack Detection and Growth Monitoring
par: Forest, Florent, et autres
Publié: (2023)
par: Forest, Florent, et autres
Publié: (2023)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
par: Yao, Kelu, et autres
Publié: (2025)
par: Yao, Kelu, et autres
Publié: (2025)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
par: Liu, Chenyang, et autres
Publié: (2024)
par: Liu, Chenyang, et autres
Publié: (2024)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
par: Pang, Chao, et autres
Publié: (2024)
par: Pang, Chao, et autres
Publié: (2024)
Documents similaires
-
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2024) -
Large Language Models for Captioning and Retrieving Remote Sensing Images
par: Silva, João Daniel, et autres
Publié: (2024) -
SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing Images
par: Sumbul, Gencer, et autres
Publié: (2025) -
Knowledge-aware Visual Question Generation for Remote Sensing Images
par: Li, Siran, et autres
Publié: (2026) -
Knowledge-aware Text-Image Retrieval for Remote Sensing Images
par: Mi, Li, et autres
Publié: (2024)