RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation
Fuente:
arXiv
Saved in:
| Main Authors: | Min, Rui, Yao, Liang, Miao, Shiyu, Xu, Shengxiang, Liu, Yuxuan, Zhang, Chuanyi, Di, Shimin, Liu, Fan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs
by: Yao, Liang, et al.
Published: (2026)
by: Yao, Liang, et al.
Published: (2026)
RemoteZero: Geospatial Reasoning with Zero Human Annotations
by: Yao, Liang, et al.
Published: (2026)
by: Yao, Liang, et al.
Published: (2026)
RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow
by: Yao, Liang, et al.
Published: (2025)
by: Yao, Liang, et al.
Published: (2025)
RemoteSAM: Towards Segment Anything for Earth Observation
by: Yao, Liang, et al.
Published: (2025)
by: Yao, Liang, et al.
Published: (2025)
RemoteTrimmer: Adaptive Structural Pruning for Remote Sensing Image Classification
by: Zou, Guangwenjie, et al.
Published: (2024)
by: Zou, Guangwenjie, et al.
Published: (2024)
UEMM-Air: Make Unmanned Aerial Vehicles Perform More Multi-modal Tasks
by: Yao, Liang, et al.
Published: (2024)
by: Yao, Liang, et al.
Published: (2024)
Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images
by: Miao, Shiyu, et al.
Published: (2024)
by: Miao, Shiyu, et al.
Published: (2024)
Evaluating Remote Sensing Image Captions Beyond Metric Biases
by: Chen, Ziyun, et al.
Published: (2026)
by: Chen, Ziyun, et al.
Published: (2026)
RobustFlow: Towards Robust Agentic Workflow Generation
by: Xu, Shengxiang, et al.
Published: (2025)
by: Xu, Shengxiang, et al.
Published: (2025)
Disentangle Object and Non-object Infrared Features via Language Guidance
by: Liu, Fan, et al.
Published: (2026)
by: Liu, Fan, et al.
Published: (2026)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
by: Li, Jiaqi, et al.
Published: (2024)
by: Li, Jiaqi, et al.
Published: (2024)
Deep Multimodal Fusion for Semantic Segmentation of Remote Sensing Earth Observation Data
by: Dimitrovski, Ivica, et al.
Published: (2024)
by: Dimitrovski, Ivica, et al.
Published: (2024)
Domain-invariant Progressive Knowledge Distillation for UAV-based Object Detection
by: Yao, Liang, et al.
Published: (2024)
by: Yao, Liang, et al.
Published: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
by: Zhao, Shiyu, et al.
Published: (2024)
by: Zhao, Shiyu, et al.
Published: (2024)
Making Large Vision Language Models to be Good Few-shot Learners
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data
by: Wang, Fengxiang, et al.
Published: (2025)
by: Wang, Fengxiang, et al.
Published: (2025)
REOBench: Benchmarking Robustness of Earth Observation Foundation Models
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
TerraMind: Large-Scale Generative Multimodality for Earth Observation
by: Jakubik, Johannes, et al.
Published: (2025)
by: Jakubik, Johannes, et al.
Published: (2025)
ChronoEarth-492K: A Large Scale and Long Horizon Spatiotemporal Hyperspectral Earth Observation Dataset and Benchmark
by: Si, Haozhe, et al.
Published: (2026)
by: Si, Haozhe, et al.
Published: (2026)
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2025)
by: Xiong, Zhitong, et al.
Published: (2025)
Foundation Models for Remote Sensing and Earth Observation: A Survey
by: Xiao, Aoran, et al.
Published: (2024)
by: Xiao, Aoran, et al.
Published: (2024)
Boost UAV-based Ojbect Detection via Scale-Invariant Feature Disentanglement and Adversarial Learning
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
by: Peng, Jihua, et al.
Published: (2025)
by: Peng, Jihua, et al.
Published: (2025)
FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
by: Wang, Hongyang, et al.
Published: (2025)
by: Wang, Hongyang, et al.
Published: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
by: Wang, Yuxuan, et al.
Published: (2024)
by: Wang, Yuxuan, et al.
Published: (2024)
OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation
by: Herzog, Henry, et al.
Published: (2025)
by: Herzog, Henry, et al.
Published: (2025)
TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data
by: Irvin, Jeremy Andrew, et al.
Published: (2024)
by: Irvin, Jeremy Andrew, et al.
Published: (2024)
RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation
by: Houdré, Nicolas, et al.
Published: (2025)
by: Houdré, Nicolas, et al.
Published: (2025)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
by: Shen, Yijun, et al.
Published: (2025)
by: Shen, Yijun, et al.
Published: (2025)
OpenEarthSensing: Large-Scale Fine-Grained Benchmark for Open-World Remote Sensing
by: Xiang, Xiang, et al.
Published: (2025)
by: Xiang, Xiang, et al.
Published: (2025)
SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining
by: Braham, Nassim Ait Ali, et al.
Published: (2026)
by: Braham, Nassim Ait Ali, et al.
Published: (2026)
Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models
by: Li, Xiaohe, et al.
Published: (2026)
by: Li, Xiaohe, et al.
Published: (2026)
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
by: Qu, Bingzheng, et al.
Published: (2026)
by: Qu, Bingzheng, et al.
Published: (2026)
FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing
by: Yang, Yi, et al.
Published: (2025)
by: Yang, Yi, et al.
Published: (2025)
Neural Plasticity-Inspired Multimodal Foundation Model for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2024)
by: Xiong, Zhitong, et al.
Published: (2024)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
by: Wu, Peiran, et al.
Published: (2025)
by: Wu, Peiran, et al.
Published: (2025)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
by: Zhang, Xinyu, et al.
Published: (2026)
by: Zhang, Xinyu, et al.
Published: (2026)
Combating Noisy Labels via Dynamic Connection Masking
by: Zhang, Xinlei, et al.
Published: (2025)
by: Zhang, Xinlei, et al.
Published: (2025)
Similar Items
-
RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs
by: Yao, Liang, et al.
Published: (2026) -
RemoteZero: Geospatial Reasoning with Zero Human Annotations
by: Yao, Liang, et al.
Published: (2026) -
RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow
by: Yao, Liang, et al.
Published: (2025) -
RemoteSAM: Towards Segment Anything for Earth Observation
by: Yao, Liang, et al.
Published: (2025) -
RemoteTrimmer: Adaptive Structural Pruning for Remote Sensing Image Classification
by: Zou, Guangwenjie, et al.
Published: (2024)