GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zilun, Shen, Haozhan, Zhao, Tiancheng, Chen, Bin, Guan, Zian, Wang, Yuhao, Jia, Xu, Cai, Yuxiang, Shang, Yongheng, Yin, Jianwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023)
par: Zhang, Zilun, et autres
Publié: (2023)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024)
par: Shen, Haozhan, et autres
Publié: (2024)
Talking to Yourself: Defying Forgetting in Large Language Models
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
par: Guo, Yulong, et autres
Publié: (2025)
par: Guo, Yulong, et autres
Publié: (2025)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
par: Xiao, Aoran, et autres
Publié: (2026)
par: Xiao, Aoran, et autres
Publié: (2026)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
par: Shen, Haozhan, et autres
Publié: (2025)
par: Shen, Haozhan, et autres
Publié: (2025)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
par: Zhang, Zilun, et autres
Publié: (2022)
par: Zhang, Zilun, et autres
Publié: (2022)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
par: Liu, Fan, et autres
Publié: (2023)
par: Liu, Fan, et autres
Publié: (2023)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2025)
par: Silva, João Daniel, et autres
Publié: (2025)
FLAVARS: A Multimodal Foundational Language and Vision Alignment Model for Remote Sensing
par: Corley, Isaac, et autres
Publié: (2025)
par: Corley, Isaac, et autres
Publié: (2025)
GeoGalactica: A Scientific Large Language Model in Geoscience
par: Lin, Zhouhan, et autres
Publié: (2023)
par: Lin, Zhouhan, et autres
Publié: (2023)
Efficient Few‐Shot Learning in Remote Sensing: Fusing Vision and Vision‐Language Models
par: Jia Yun Chua, et autres
Publié: (2025)
par: Jia Yun Chua, et autres
Publié: (2025)
Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models
par: Chua, Jia Yun, et autres
Publié: (2025)
par: Chua, Jia Yun, et autres
Publié: (2025)
LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
par: Li, Zhenshi, et autres
Publié: (2024)
par: Li, Zhenshi, et autres
Publié: (2024)
Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing
par: Jiang, Hongxiang, et autres
Publié: (2025)
par: Jiang, Hongxiang, et autres
Publié: (2025)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
par: Li, Yujie, et autres
Publié: (2024)
par: Li, Yujie, et autres
Publié: (2024)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
par: Zhan, Yang, et autres
Publié: (2024)
par: Zhan, Yang, et autres
Publié: (2024)
Diverse Instance Generation via Diffusion Models for Enhanced Few-Shot Object Detection in Remote Sensing Images
par: Liu, Yanxing, et autres
Publié: (2025)
par: Liu, Yanxing, et autres
Publié: (2025)
MineAgent: Towards Remote-Sensing Mineral Exploration with Multimodal Large Language Models
par: Yu, Beibei, et autres
Publié: (2024)
par: Yu, Beibei, et autres
Publié: (2024)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection
par: Wang, Chengming, et autres
Publié: (2025)
par: Wang, Chengming, et autres
Publié: (2025)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
par: Silva, João Daniel, et autres
Publié: (2024)
par: Silva, João Daniel, et autres
Publié: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
par: Weng, Xingxing, et autres
Publié: (2026)
par: Weng, Xingxing, et autres
Publié: (2026)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025)
par: Liu, Peng, et autres
Publié: (2025)
Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
par: Shen, Tiancheng, et autres
Publié: (2024)
par: Shen, Tiancheng, et autres
Publié: (2024)
A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks
par: Liang, Chia Xin, et autres
Publié: (2024)
par: Liang, Chia Xin, et autres
Publié: (2024)
ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing
par: Ma, Xingwei, et autres
Publié: (2025)
par: Ma, Xingwei, et autres
Publié: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
par: Luo, Zhiming, et autres
Publié: (2026)
par: Luo, Zhiming, et autres
Publié: (2026)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
par: Dang, Yunkai, et autres
Publié: (2025)
par: Dang, Yunkai, et autres
Publié: (2025)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
par: Weng, Xingxing, et autres
Publié: (2025)
par: Weng, Xingxing, et autres
Publié: (2025)
Documents similaires
-
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
par: Zhang, Zilun, et autres
Publié: (2024) -
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023) -
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
par: Zhang, Zilun, et autres
Publié: (2025) -
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024)