Co-Training Vision Language Models for Remote Sensing Multi-task Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Qingyun, Ma, Shuran, Luo, Junwei, Yu, Yi, Zhou, Yue, Wang, Fengxiang, Lu, Xudong, Wang, Xiaoxing, He, Xin, Chen, Yushi, Yang, Xue |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
Object Fidelity Diffusion for Remote Sensing Image Generation
by: Ye, Ziqi, et al.
Published: (2025)
by: Ye, Ziqi, et al.
Published: (2025)
A Simple Aerial Detection Baseline of Multimodal Language Models
by: Li, Qingyun, et al.
Published: (2025)
by: Li, Qingyun, et al.
Published: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
by: Luo, Junwei, et al.
Published: (2024)
by: Luo, Junwei, et al.
Published: (2024)
CGEarthEye:A High-Resolution Remote Sensing Vision Foundation Model Based on the Jilin-1 Satellite Constellation
by: Yi, Zhiwei, et al.
Published: (2025)
by: Yi, Zhiwei, et al.
Published: (2025)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
by: Wang, Shanwen, et al.
Published: (2026)
by: Wang, Shanwen, et al.
Published: (2026)
InstructSAM: A Training-Free Framework for Instruction-Oriented Remote Sensing Object Recognition
by: Zheng, Yijie, et al.
Published: (2025)
by: Zheng, Yijie, et al.
Published: (2025)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
by: Luo, Junwei, et al.
Published: (2025)
by: Luo, Junwei, et al.
Published: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
by: Li, Yueying, et al.
Published: (2026)
by: Li, Yueying, et al.
Published: (2026)
A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning
by: Zhou, Qing, et al.
Published: (2025)
by: Zhou, Qing, et al.
Published: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
by: Zhou, Jiaming, et al.
Published: (2025)
by: Zhou, Jiaming, et al.
Published: (2025)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
by: Luo, Zhiming, et al.
Published: (2026)
by: Luo, Zhiming, et al.
Published: (2026)
ChangeMinds: Multi-task Framework for Detecting and Describing Changes in Remote Sensing
by: Wang, Yuduo, et al.
Published: (2024)
by: Wang, Yuduo, et al.
Published: (2024)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
by: Zhang, Peirong, et al.
Published: (2025)
by: Zhang, Peirong, et al.
Published: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
by: Liu, Fan, et al.
Published: (2023)
by: Liu, Fan, et al.
Published: (2023)
PhysMLE: Generalizable and Priors-Inclusive Multi-task Remote Physiological Measurement
by: Wang, Jiyao, et al.
Published: (2024)
by: Wang, Jiyao, et al.
Published: (2024)
Prompting Large Language Models for Training-Free Non-Intrusive Load Monitoring
by: Xue, Junyu, et al.
Published: (2025)
by: Xue, Junyu, et al.
Published: (2025)
RSDehamba: Lightweight Vision Mamba for Remote Sensing Satellite Image Dehazing
by: Zhou, Huiling, et al.
Published: (2024)
by: Zhou, Huiling, et al.
Published: (2024)
MMSense: Adapting Vision-based Foundation Model for Multi-task Multi-modal Wireless Sensing
by: Li, Zhizhen, et al.
Published: (2025)
by: Li, Zhizhen, et al.
Published: (2025)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
by: Gong, Ziyang, et al.
Published: (2024)
by: Gong, Ziyang, et al.
Published: (2024)
EMind: A Foundation Model for Multi-task Electromagnetic Signals Understanding
by: Luo, Luqing, et al.
Published: (2025)
by: Luo, Luqing, et al.
Published: (2025)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
by: Pang, Chao, et al.
Published: (2024)
by: Pang, Chao, et al.
Published: (2024)
PointOBB-v3: Expanding Performance Boundaries of Single Point-Supervised Oriented Object Detection
by: Zhang, Peiyuan, et al.
Published: (2025)
by: Zhang, Peiyuan, et al.
Published: (2025)
Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models
by: Lian, Xiaoxing, et al.
Published: (2025)
by: Lian, Xiaoxing, et al.
Published: (2025)
Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding
by: Wang, Fengxiang, et al.
Published: (2026)
by: Wang, Fengxiang, et al.
Published: (2026)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
by: An, Xiao, et al.
Published: (2024)
by: An, Xiao, et al.
Published: (2024)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
by: Li, Yujie, et al.
Published: (2024)
by: Li, Yujie, et al.
Published: (2024)
RoMA: Scaling up Mamba-based Foundation Models for Remote Sensing
by: Wang, Fengxiang, et al.
Published: (2025)
by: Wang, Fengxiang, et al.
Published: (2025)
Bi-temporal Gaussian Feature Dependency Guided Change Detection in Remote Sensing Images
by: Xiao, Yi, et al.
Published: (2024)
by: Xiao, Yi, et al.
Published: (2024)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
by: Dang, Yunkai, et al.
Published: (2025)
by: Dang, Yunkai, et al.
Published: (2025)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
by: Weng, Xingxing, et al.
Published: (2026)
by: Weng, Xingxing, et al.
Published: (2026)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
by: Yao, Kelu, et al.
Published: (2025)
by: Yao, Kelu, et al.
Published: (2025)
SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation
by: Ma, Zhiming, et al.
Published: (2025)
by: Ma, Zhiming, et al.
Published: (2025)
ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing
by: Ma, Xingwei, et al.
Published: (2025)
by: Ma, Xingwei, et al.
Published: (2025)
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
by: Wang, Fengxiang, et al.
Published: (2025)
by: Wang, Fengxiang, et al.
Published: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
by: Yin, Wenjing, et al.
Published: (2025)
by: Yin, Wenjing, et al.
Published: (2025)
From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG
by: Han, Jiaju, et al.
Published: (2026)
by: Han, Jiaju, et al.
Published: (2026)
Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion
by: Zhou, Yi, et al.
Published: (2025)
by: Zhou, Yi, et al.
Published: (2025)
Training-free LLM Merging for Multi-task Learning
by: Fu, Zichuan, et al.
Published: (2025)
by: Fu, Zichuan, et al.
Published: (2025)
Vision Foundation Models in Remote Sensing: A Survey
by: Lu, Siqi, et al.
Published: (2024)
by: Lu, Siqi, et al.
Published: (2024)
Similar Items
-
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024) -
Object Fidelity Diffusion for Remote Sensing Image Generation
by: Ye, Ziqi, et al.
Published: (2025) -
A Simple Aerial Detection Baseline of Multimodal Language Models
by: Li, Qingyun, et al.
Published: (2025) -
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
by: Luo, Junwei, et al.
Published: (2024) -
CGEarthEye:A High-Resolution Remote Sensing Vision Foundation Model Based on the Jilin-1 Satellite Constellation
by: Yi, Zhiwei, et al.
Published: (2025)