Rethinking Electro-Optical Vision Foundation Models for Remote Sensing Retrieval: A Controlled Comparison with Generalist VFM
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Hyobin, Seo, Minseok, Choi, Dong-Geol |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
by: Sarowar, Md Selim, et al.
Published: (2025)
by: Sarowar, Md Selim, et al.
Published: (2025)
BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis
by: Liu, Jiarun, et al.
Published: (2025)
by: Liu, Jiarun, et al.
Published: (2025)
A Billion-scale Foundation Model for Remote Sensing Images
by: Cha, Keumgang, et al.
Published: (2023)
by: Cha, Keumgang, et al.
Published: (2023)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
by: He, Xingxin, et al.
Published: (2025)
by: He, Xingxin, et al.
Published: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)
by: Pan, Jiancheng, et al.
Published: (2024)
Vision Generalist Model: A Survey
by: Wang, Ziyi, et al.
Published: (2025)
by: Wang, Ziyi, et al.
Published: (2025)
VFM-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images
by: Wang, Deliang, et al.
Published: (2025)
by: Wang, Deliang, et al.
Published: (2025)
OceanMAE: A Foundation Model for Ocean Remote Sensing
by: Stamer, Viola-Joanna, et al.
Published: (2026)
by: Stamer, Viola-Joanna, et al.
Published: (2026)
From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG
by: Han, Jiaju, et al.
Published: (2026)
by: Han, Jiaju, et al.
Published: (2026)
Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries
by: Mezzi, Emanuele, et al.
Published: (2025)
by: Mezzi, Emanuele, et al.
Published: (2025)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
by: Wen, Congcong, et al.
Published: (2025)
by: Wen, Congcong, et al.
Published: (2025)
GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing
by: Hasan, Maram, et al.
Published: (2026)
by: Hasan, Maram, et al.
Published: (2026)
CGEarthEye:A High-Resolution Remote Sensing Vision Foundation Model Based on the Jilin-1 Satellite Constellation
by: Yi, Zhiwei, et al.
Published: (2025)
by: Yi, Zhiwei, et al.
Published: (2025)
FedRSClip: Federated Learning for Remote Sensing Scene Classification Using Vision-Language Models
by: Lin, Hui, et al.
Published: (2025)
by: Lin, Hui, et al.
Published: (2025)
PBVS 2024 Solution: Self-Supervised Learning and Sampling Strategies for SAR Classification in Extreme Long-Tail Distribution
by: Kim, Yuhyun, et al.
Published: (2024)
by: Kim, Yuhyun, et al.
Published: (2024)
Heuristical Comparison of Vision Transformers Against Convolutional Neural Networks for Semantic Segmentation on Remote Sensing Imagery
by: Dahal, Ashim, et al.
Published: (2024)
by: Dahal, Ashim, et al.
Published: (2024)
A High-Level Survey of Optical Remote Sensing
by: Koletsis, Panagiotis, et al.
Published: (2026)
by: Koletsis, Panagiotis, et al.
Published: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
by: Chen, Weizhi, et al.
Published: (2025)
by: Chen, Weizhi, et al.
Published: (2025)
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
by: Fan, Jiawei, et al.
Published: (2026)
by: Fan, Jiawei, et al.
Published: (2026)
RoMA: Scaling up Mamba-based Foundation Models for Remote Sensing
by: Wang, Fengxiang, et al.
Published: (2025)
by: Wang, Fengxiang, et al.
Published: (2025)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
by: Dang, Yunkai, et al.
Published: (2025)
by: Dang, Yunkai, et al.
Published: (2025)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
by: Li, Xiang, et al.
Published: (2023)
by: Li, Xiang, et al.
Published: (2023)
VFM-Det: Towards High-Performance Vehicle Detection via Large Foundation Models
by: Wu, Wentao, et al.
Published: (2024)
by: Wu, Wentao, et al.
Published: (2024)
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
by: Wang, Shansong, et al.
Published: (2025)
by: Wang, Shansong, et al.
Published: (2025)
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
by: Shi, Danli, et al.
Published: (2024)
by: Shi, Danli, et al.
Published: (2024)
Image Generators are Generalist Vision Learners
by: Gabeur, Valentin, et al.
Published: (2026)
by: Gabeur, Valentin, et al.
Published: (2026)
NitroGen: An Open Foundation Model for Generalist Gaming Agents
by: Magne, Loïc, et al.
Published: (2026)
by: Magne, Loïc, et al.
Published: (2026)
Towards Efficient Benchmarking of Foundation Models in Remote Sensing: A Capabilities Encoding Approach
by: Adorni, Pierre, et al.
Published: (2025)
by: Adorni, Pierre, et al.
Published: (2025)
REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent
by: Chen, Binger, et al.
Published: (2025)
by: Chen, Binger, et al.
Published: (2025)
Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval
by: Ma, Qing, et al.
Published: (2023)
by: Ma, Qing, et al.
Published: (2023)
FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales
by: Rodriguez, Jorge L., et al.
Published: (2026)
by: Rodriguez, Jorge L., et al.
Published: (2026)
RingMo-Aerial: An Aerial Remote Sensing Foundation Model With Affine Transformation Contrastive Learning
by: Diao, Wenhui, et al.
Published: (2024)
by: Diao, Wenhui, et al.
Published: (2024)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
by: Wang, Shanwen, et al.
Published: (2026)
by: Wang, Shanwen, et al.
Published: (2026)
SatVision-TOA: A Geospatial Foundation Model for Coarse-Resolution All-Sky Remote Sensing Imagery
by: Spradlin, Caleb S., et al.
Published: (2024)
by: Spradlin, Caleb S., et al.
Published: (2024)
Detecting Brick Kiln Infrastructure at Scale: Graph, Foundation, and Remote Sensing Models for Satellite Imagery Data
by: Nazir, Usman, et al.
Published: (2026)
by: Nazir, Usman, et al.
Published: (2026)
ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts
by: Choi, Sangbum, et al.
Published: (2025)
by: Choi, Sangbum, et al.
Published: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
by: Zhong, Chen, et al.
Published: (2026)
by: Zhong, Chen, et al.
Published: (2026)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
by: Luo, Junwei, et al.
Published: (2024)
by: Luo, Junwei, et al.
Published: (2024)
Investigating Long-term Training for Remote Sensing Object Detection
by: Park, JongHyun, et al.
Published: (2024)
by: Park, JongHyun, et al.
Published: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
by: Luo, Zhiming, et al.
Published: (2026)
by: Luo, Zhiming, et al.
Published: (2026)
Similar Items
-
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
by: Sarowar, Md Selim, et al.
Published: (2025) -
BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis
by: Liu, Jiarun, et al.
Published: (2025) -
A Billion-scale Foundation Model for Remote Sensing Images
by: Cha, Keumgang, et al.
Published: (2023) -
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
by: He, Xingxin, et al.
Published: (2025) -
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)