Advancements in Visual Language Models for Remote Sensing: Datasets, Capabilities, and Enhancement Techniques
Fuente:
arXiv
Saved in:
| Main Authors: | Tao, Lijie, Zhang, Haokui, Jing, Haizhao, Liu, Yu, Yan, Dawei, Wei, Guoting, Xue, Xizhe |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Bridging Sensor Gaps via Attention Gated Tuning for Hyperspectral Image Classification
by: Xue, Xizhe, et al.
Published: (2023)
by: Xue, Xizhe, et al.
Published: (2023)
MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
by: Yan, Dawei, et al.
Published: (2025)
by: Yan, Dawei, et al.
Published: (2025)
3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification
by: Jing, Haizhao, et al.
Published: (2024)
by: Jing, Haizhao, et al.
Published: (2024)
UVLM: Benchmarking Video Language Model for Underwater World Understanding
by: Xue, Xizhe, et al.
Published: (2025)
by: Xue, Xizhe, et al.
Published: (2025)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
by: Shang, Zhenhao, et al.
Published: (2026)
by: Shang, Zhenhao, et al.
Published: (2026)
MineAgent: Towards Remote-Sensing Mineral Exploration with Multimodal Large Language Models
by: Yu, Beibei, et al.
Published: (2024)
by: Yu, Beibei, et al.
Published: (2024)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
by: Zhou, Lijie
Published: (2026)
by: Zhou, Lijie
Published: (2026)
Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges
by: Li, Haifeng, et al.
Published: (2025)
by: Li, Haifeng, et al.
Published: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
by: Zhong, Chen, et al.
Published: (2026)
by: Zhong, Chen, et al.
Published: (2026)
Revisiting the Travel Planning Capabilities of Large Language Models
by: Zhang, Bo-Wen, et al.
Published: (2026)
by: Zhang, Bo-Wen, et al.
Published: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
by: Chen, Weizhi, et al.
Published: (2025)
by: Chen, Weizhi, et al.
Published: (2025)
Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection
by: Wei, Guoting, et al.
Published: (2026)
by: Wei, Guoting, et al.
Published: (2026)
Graph Learning and Its Advancements on Large Language Models: A Holistic Survey
by: Wei, Shaopeng, et al.
Published: (2022)
by: Wei, Shaopeng, et al.
Published: (2022)
WalnutData: A UAV Remote Sensing Dataset of Green Walnuts and Model Evaluation
by: Wu, Mingjie, et al.
Published: (2025)
by: Wu, Mingjie, et al.
Published: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
by: Luo, Junwei, et al.
Published: (2024)
by: Luo, Junwei, et al.
Published: (2024)
Graph Information Bottleneck for Remote Sensing Segmentation
by: Shou, Yuntao, et al.
Published: (2023)
by: Shou, Yuntao, et al.
Published: (2023)
Towards Efficient Benchmarking of Foundation Models in Remote Sensing: A Capabilities Encoding Approach
by: Adorni, Pierre, et al.
Published: (2025)
by: Adorni, Pierre, et al.
Published: (2025)
FedRS-Bench: Realistic Federated Learning Datasets and Benchmarks in Remote Sensing
by: Zhao, Haodong, et al.
Published: (2025)
by: Zhao, Haodong, et al.
Published: (2025)
Exploring the Word Sense Disambiguation Capabilities of Large Language Models
by: Basile, Pierpaolo, et al.
Published: (2025)
by: Basile, Pierpaolo, et al.
Published: (2025)
Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
by: Lu, Kaixuan, et al.
Published: (2024)
by: Lu, Kaixuan, et al.
Published: (2024)
REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation
by: Xue, Xizhe, et al.
Published: (2024)
by: Xue, Xizhe, et al.
Published: (2024)
CATS-Linear: Classification Auxiliary Linear Model for Time Series Forecasting
by: Jibao, Zipo, et al.
Published: (2025)
by: Jibao, Zipo, et al.
Published: (2025)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
by: Shao, Run, et al.
Published: (2024)
by: Shao, Run, et al.
Published: (2024)
Manifold-based Sampling for In-Context Hallucination Detection in Large Language Models
by: Vamshi, Bodla Krishna, et al.
Published: (2026)
by: Vamshi, Bodla Krishna, et al.
Published: (2026)
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
by: Lu, Kaixuan
Published: (2024)
by: Lu, Kaixuan
Published: (2024)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
by: Pan, Jiancheng, et al.
Published: (2024)
by: Pan, Jiancheng, et al.
Published: (2024)
FSDENet: A Frequency and Spatial Domains based Detail Enhancement Network for Remote Sensing Semantic Segmentation
by: Fu, Jiahao, et al.
Published: (2025)
by: Fu, Jiahao, et al.
Published: (2025)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
by: Luo, Zhiming, et al.
Published: (2026)
by: Luo, Zhiming, et al.
Published: (2026)
IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
by: Wang, Bin, et al.
Published: (2024)
by: Wang, Bin, et al.
Published: (2024)
Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy
by: Yang, Te, et al.
Published: (2024)
by: Yang, Te, et al.
Published: (2024)
OS-W2S: An Automatic Labeling Engine for Language-Guided Open-Set Aerial Object Detection
by: Wei, Guoting, et al.
Published: (2025)
by: Wei, Guoting, et al.
Published: (2025)
RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecasting
by: Xu, Linrui, et al.
Published: (2026)
by: Xu, Linrui, et al.
Published: (2026)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
by: Wen, Congcong, et al.
Published: (2025)
by: Wen, Congcong, et al.
Published: (2025)
Consistency Change Detection Framework for Unsupervised Remote Sensing Change Detection
by: Liu, Yating, et al.
Published: (2025)
by: Liu, Yating, et al.
Published: (2025)
A Simple Review of EEG Foundation Models: Datasets, Advancements and Future Perspectives
by: Lai, Junhong, et al.
Published: (2025)
by: Lai, Junhong, et al.
Published: (2025)
MEET: A Million-Scale Dataset for Fine-Grained Geospatial Scene Classification with Zoom-Free Remote Sensing Imagery
by: Li, Yansheng, et al.
Published: (2025)
by: Li, Yansheng, et al.
Published: (2025)
Mask Approximation Net: A Novel Diffusion Model Approach for Remote Sensing Change Captioning
by: Sun, Dongwei, et al.
Published: (2024)
by: Sun, Dongwei, et al.
Published: (2024)
Efficient Adaptation For Remote Sensing Visual Grounding
by: Moughnieh, Hasan, et al.
Published: (2025)
by: Moughnieh, Hasan, et al.
Published: (2025)
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
by: Zi, Xing, et al.
Published: (2025)
by: Zi, Xing, et al.
Published: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
by: Wang, Fengxiang, et al.
Published: (2026)
by: Wang, Fengxiang, et al.
Published: (2026)
Similar Items
-
Bridging Sensor Gaps via Attention Gated Tuning for Hyperspectral Image Classification
by: Xue, Xizhe, et al.
Published: (2023) -
MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
by: Yan, Dawei, et al.
Published: (2025) -
3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification
by: Jing, Haizhao, et al.
Published: (2024) -
UVLM: Benchmarking Video Language Model for Underwater World Understanding
by: Xue, Xizhe, et al.
Published: (2025) -
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
by: Shang, Zhenhao, et al.
Published: (2026)