Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yuxuan, Chen, Yuming, Li, Yunheng, Cheng, Ming-Ming, Li, Xiang, Yang, Jian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
Strip R-CNN: Large Strip Convolution for Remote Sensing Object Detection
par: Yuan, Xinbin, et autres
Publié: (2025)
par: Yuan, Xinbin, et autres
Publié: (2025)
LSKNet: A Foundation Lightweight Backbone for Remote Sensing
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
Visual Instruction Pretraining for Domain-Specific Foundation Models
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
YOLO-MS: Rethinking Multi-Scale Representation Learning for Real-time Object Detection
par: Chen, Yuming, et autres
Publié: (2023)
par: Chen, Yuming, et autres
Publié: (2023)
PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
par: Li, Zhong-Yu, et autres
Publié: (2024)
par: Li, Zhong-Yu, et autres
Publié: (2024)
Zone Evaluation: Revealing Spatial Bias in Object Detection
par: Zheng, Zhaohui, et autres
Publié: (2023)
par: Zheng, Zhaohui, et autres
Publié: (2023)
RSAR: Restricted State Angle Resolver and Rotated SAR Benchmark
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
CrossKD: Cross-Head Knowledge Distillation for Object Detection
par: Wang, Jiabao, et autres
Publié: (2023)
par: Wang, Jiabao, et autres
Publié: (2023)
From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing
par: Sun, Xintian, et autres
Publié: (2024)
par: Sun, Xintian, et autres
Publié: (2024)
SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
Any2Any: Unified Arbitrary Modality Translation for Remote Sensing
par: Chen, Haoyang, et autres
Publié: (2026)
par: Chen, Haoyang, et autres
Publié: (2026)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature Alignment
par: Zhang, Shi-Chen, et autres
Publié: (2025)
par: Zhang, Shi-Chen, et autres
Publié: (2025)
Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion
par: Li, Xilai, et autres
Publié: (2025)
par: Li, Xilai, et autres
Publié: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
OmniSegmentor: A Flexible Multi-Modal Learning Framework for Semantic Segmentation
par: Yin, Bo-Wen, et autres
Publié: (2025)
par: Yin, Bo-Wen, et autres
Publié: (2025)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
par: Li, Yujie, et autres
Publié: (2024)
par: Li, Yujie, et autres
Publié: (2024)
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
par: Zeng, Quan-Sheng, et autres
Publié: (2024)
par: Zeng, Quan-Sheng, et autres
Publié: (2024)
Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models
par: Li, Xiaohe, et autres
Publié: (2026)
par: Li, Xiaohe, et autres
Publié: (2026)
UniRoute: Unified Routing Mixture-of-Experts for Modality-Adaptive Remote Sensing Change Detection
par: Shu, Qingling, et autres
Publié: (2026)
par: Shu, Qingling, et autres
Publié: (2026)
Rethinking the Key Factors for the Generalization of Remote Sensing Stereo Matching Networks
par: Jiang, Liting, et autres
Publié: (2024)
par: Jiang, Liting, et autres
Publié: (2024)
DenoDet V2: Phase-Amplitude Cross Denoising for SAR Object Detection
par: Ni, Kang, et autres
Publié: (2025)
par: Ni, Kang, et autres
Publié: (2025)
DISTA-Net: Dynamic Closely-Spaced Infrared Small Target Unmixing
par: Han, Shengdong, et autres
Publié: (2025)
par: Han, Shengdong, et autres
Publié: (2025)
Advancing Textual Prompt Learning with Anchored Attributes
par: Li, Zheng, et autres
Publié: (2024)
par: Li, Zheng, et autres
Publié: (2024)
SkySense V2: A Unified Foundation Model for Multi-modal Remote Sensing
par: Zhang, Yingying, et autres
Publié: (2025)
par: Zhang, Yingying, et autres
Publié: (2025)
WOW-Seg: A Word-free Open World Segmentation Model
par: Li, Danyang, et autres
Publié: (2026)
par: Li, Danyang, et autres
Publié: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
par: Li, Yunheng, et autres
Publié: (2025)
par: Li, Yunheng, et autres
Publié: (2025)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
par: Wen, Congcong, et autres
Publié: (2025)
par: Wen, Congcong, et autres
Publié: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
par: Xu, Jinjin, et autres
Publié: (2023)
par: Xu, Jinjin, et autres
Publié: (2023)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
par: Li, Wenshuai, et autres
Publié: (2026)
par: Li, Wenshuai, et autres
Publié: (2026)
A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting
par: Cui, Yongchuan, et autres
Publié: (2026)
par: Cui, Yongchuan, et autres
Publié: (2026)
Lightweight Change Detection in Heterogeneous Remote Sensing Images with Online All-Integer Pruning Training
par: Zhang, Chengyang, et autres
Publié: (2024)
par: Zhang, Chengyang, et autres
Publié: (2024)
SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
Task Specific Pretraining with Noisy Labels for Remote Sensing Image Segmentation
par: Liu, Chenying, et autres
Publié: (2024)
par: Liu, Chenying, et autres
Publié: (2024)
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
par: Peng, Bowen, et autres
Publié: (2026)
par: Peng, Bowen, et autres
Publié: (2026)
DenoDet: Attention as Deformable Multi-Subspace Feature Denoising for Target Detection in SAR Images
par: Dai, Yimian, et autres
Publié: (2024)
par: Dai, Yimian, et autres
Publié: (2024)
Documents similaires
-
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
par: Li, Yuxuan, et autres
Publié: (2024) -
Strip R-CNN: Large Strip Convolution for Remote Sensing Object Detection
par: Yuan, Xinbin, et autres
Publié: (2025) -
LSKNet: A Foundation Lightweight Backbone for Remote Sensing
par: Li, Yuxuan, et autres
Publié: (2024) -
Visual Instruction Pretraining for Domain-Specific Foundation Models
par: Li, Yuxuan, et autres
Publié: (2025) -
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
par: Li, Yunheng, et autres
Publié: (2024)