MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP
Fuente:
arXiv
Saved in:
| Main Authors: | Chaudhary, Aditya, Barman, Sneha, Singha, Mainak, Jha, Ankit, Mishra, Girish, Banerjee, Biplab |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
by: Singha, Mainak, et al.
Published: (2023)
by: Singha, Mainak, et al.
Published: (2023)
SDHSI-Net: Learning Better Representations for Hyperspectral Images via Self-Distillation
by: Singh, Prachet Dev, et al.
Published: (2026)
by: Singh, Prachet Dev, et al.
Published: (2026)
Unknown Prompt, the only Lacuna: Unveiling CLIP's Potential for Open Domain Generalization
by: Singha, Mainak, et al.
Published: (2024)
by: Singha, Mainak, et al.
Published: (2024)
BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs
by: Singha, Mainak, et al.
Published: (2026)
by: Singha, Mainak, et al.
Published: (2026)
Reconstruction Guided Few-shot Network For Remote Sensing Image Classification
by: Jaiswal, Mohit, et al.
Published: (2026)
by: Jaiswal, Mohit, et al.
Published: (2026)
COSMo: CLIP Talks on Open-Set Multi-Target Domain Adaptation
by: Monga, Munish, et al.
Published: (2024)
by: Monga, Munish, et al.
Published: (2024)
Elevating All Zero-Shot Sketch-Based Image Retrieval Through Multimodal Prompt Learning
by: Singha, Mainak, et al.
Published: (2024)
by: Singha, Mainak, et al.
Published: (2024)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
by: Solanki, Bhupendra, et al.
Published: (2024)
by: Solanki, Bhupendra, et al.
Published: (2024)
OSLoPrompt: Bridging Low-Supervision Challenges and Open-Set Domain Generalization in CLIP
by: C, Mohamad Hassan N, et al.
Published: (2025)
by: C, Mohamad Hassan N, et al.
Published: (2025)
bi-modal textual prompt learning for vision-language models in remote sensing
by: Kashyap, Pankhi, et al.
Published: (2026)
by: Kashyap, Pankhi, et al.
Published: (2026)
FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models
by: Singha, Mainak, et al.
Published: (2025)
by: Singha, Mainak, et al.
Published: (2025)
CR-JEPA: Cross-Modal Joint-Embedding Predictive Learning for Remote Sensing Image Retrieval
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
FrogDogNet: Fourier frequency Retained visual prompt Output Guidance for Domain Generalization of CLIP in Remote Sensing
by: Gunduboina, Hariseetharam, et al.
Published: (2025)
by: Gunduboina, Hariseetharam, et al.
Published: (2025)
HQ-JEPA: Hybrid Quantum Joint-Embedding Predictive Architecture for Cross-Modal Remote Sensing Representation Learning
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
CDAD-Net: Bridging Domain Gaps in Generalized Category Discovery
by: Rongali, Sai Bhargav, et al.
Published: (2024)
by: Rongali, Sai Bhargav, et al.
Published: (2024)
GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing
by: Hasan, Maram, et al.
Published: (2026)
by: Hasan, Maram, et al.
Published: (2026)
Two-Stage Vision Transformer for Image Restoration: Colorization Pretraining + Residual Upsampling
by: Chaudhary, Aditya, et al.
Published: (2025)
by: Chaudhary, Aditya, et al.
Published: (2025)
MIMRS: A Survey on Masked Image Modeling in Remote Sensing
by: Choudhury, Shabnam, et al.
Published: (2025)
by: Choudhury, Shabnam, et al.
Published: (2025)
QMC-Net: Data-Aware Quantum Representations for Remote Sensing Image Classification
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation
by: Singha, Mainak, et al.
Published: (2026)
by: Singha, Mainak, et al.
Published: (2026)
REJEPA: A Novel Joint-Embedding Predictive Architecture for Efficient Remote Sensing Image Retrieval
by: Choudhury, Shabnam, et al.
Published: (2025)
by: Choudhury, Shabnam, et al.
Published: (2025)
How (Mis)calibrated is Your Federated CLIP and What To Do About It?
by: Singha, Mainak, et al.
Published: (2025)
by: Singha, Mainak, et al.
Published: (2025)
Enhancing CLIP Robustness via Cross-Modality Alignment
by: Zhu, Xingyu, et al.
Published: (2025)
by: Zhu, Xingyu, et al.
Published: (2025)
HQ-UNet: A Hybrid Quantum-Classical U-Net with a Quantum Bottleneck for Remote Sensing Image Segmentation
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
AerOSeg: Harnessing SAM for Open-Vocabulary Segmentation in Remote Sensing Images
by: Dutta, Saikat, et al.
Published: (2025)
by: Dutta, Saikat, et al.
Published: (2025)
Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment
by: Zavras, Angelos, et al.
Published: (2024)
by: Zavras, Angelos, et al.
Published: (2024)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
by: Liu, Fan, et al.
Published: (2023)
by: Liu, Fan, et al.
Published: (2023)
Spatial-Frequency Gated Swin Transformer for Remote Sensing Single-Image Super-Resolution
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment
by: Huang, Tengjun
Published: (2024)
by: Huang, Tengjun
Published: (2024)
Scaling Vision-and-Language Navigation With Offline RL
by: Bundele, Valay, et al.
Published: (2024)
by: Bundele, Valay, et al.
Published: (2024)
In the Era of Prompt Learning with Vision-Language Models
by: Jha, Ankit
Published: (2024)
by: Jha, Ankit
Published: (2024)
Cross-Modal Spherical Aggregation for Weakly Supervised Remote Sensing Shadow Removal
by: Chi, Kaichen, et al.
Published: (2024)
by: Chi, Kaichen, et al.
Published: (2024)
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
by: Prakash, Nirmalendu, et al.
Published: (2026)
by: Prakash, Nirmalendu, et al.
Published: (2026)
BalancedDPO: Adaptive Multi-Metric Alignment
by: Tamboli, Dipesh, et al.
Published: (2025)
by: Tamboli, Dipesh, et al.
Published: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
by: Yang, Xiao, et al.
Published: (2026)
by: Yang, Xiao, et al.
Published: (2026)
Self-Supervised Cross-Modal Text-Image Time Series Retrieval in Remote Sensing
by: Hoxha, Genc, et al.
Published: (2025)
by: Hoxha, Genc, et al.
Published: (2025)
PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing
by: Xie, Yiping, et al.
Published: (2025)
by: Xie, Yiping, et al.
Published: (2025)
HQF-Net: A Hybrid Quantum-Classical Multi-Scale Fusion Network for Remote Sensing Image Segmentation
by: Hossain, Md Aminur, et al.
Published: (2026)
by: Hossain, Md Aminur, et al.
Published: (2026)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
by: Nawaz, Umair, et al.
Published: (2024)
by: Nawaz, Umair, et al.
Published: (2024)
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
by: Rongali, Sai Bhargav, et al.
Published: (2024)
by: Rongali, Sai Bhargav, et al.
Published: (2024)
Similar Items
-
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
by: Singha, Mainak, et al.
Published: (2023) -
SDHSI-Net: Learning Better Representations for Hyperspectral Images via Self-Distillation
by: Singh, Prachet Dev, et al.
Published: (2026) -
Unknown Prompt, the only Lacuna: Unveiling CLIP's Potential for Open Domain Generalization
by: Singha, Mainak, et al.
Published: (2024) -
BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs
by: Singha, Mainak, et al.
Published: (2026) -
Reconstruction Guided Few-shot Network For Remote Sensing Image Classification
by: Jaiswal, Mohit, et al.
Published: (2026)