SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Yulong, Zhang, Zilun, Shang, Yongheng, Zhao, Tiancheng, Deng, Shuiguang, Yang, Yingchun, Yin, Jianwei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
by: Zhang, Zilun, et al.
Published: (2023)
by: Zhang, Zilun, et al.
Published: (2023)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
by: Zhang, Zilun, et al.
Published: (2024)
by: Zhang, Zilun, et al.
Published: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
by: Zhang, Zilun, et al.
Published: (2025)
by: Zhang, Zilun, et al.
Published: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
by: Shen, Haozhan, et al.
Published: (2024)
by: Shen, Haozhan, et al.
Published: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
by: Zhang, Zilun, et al.
Published: (2022)
by: Zhang, Zilun, et al.
Published: (2022)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
by: Sun, Yutao, et al.
Published: (2025)
by: Sun, Yutao, et al.
Published: (2025)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
by: Zhao, Hailiang, et al.
Published: (2024)
by: Zhao, Hailiang, et al.
Published: (2024)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
by: Zhang, Zilun, et al.
Published: (2024)
by: Zhang, Zilun, et al.
Published: (2024)
Tail-Aware Data Augmentation for Long-Tail Sequential Recommendation
by: Dang, Yizhou, et al.
Published: (2026)
by: Dang, Yizhou, et al.
Published: (2026)
GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion
by: Wang, Xingliang, et al.
Published: (2025)
by: Wang, Xingliang, et al.
Published: (2025)
UHR-Net: An Uncertainty-Aware Hypergraph Refinement Network for Medical Image Segmentation
by: Cheng, Shuokun, et al.
Published: (2026)
by: Cheng, Shuokun, et al.
Published: (2026)
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
by: Zhao, Xinkui, et al.
Published: (2025)
by: Zhao, Xinkui, et al.
Published: (2025)
XFMNet: Decoding Cross-Site and Nonstationary Water Patterns via Stepwise Multimodal Fusion for Long-Term Water Quality Forecasting
by: Wang, Ziqi, et al.
Published: (2025)
by: Wang, Ziqi, et al.
Published: (2025)
Talking to Yourself: Defying Forgetting in Large Language Models
by: Sun, Yutao, et al.
Published: (2026)
by: Sun, Yutao, et al.
Published: (2026)
SatFusion: A Unified Framework for Enhancing Remote Sensing Images via Multi-Frame and Multi-Source Images Fusion
by: Tong, Yufei, et al.
Published: (2025)
by: Tong, Yufei, et al.
Published: (2025)
Missing-Aware Multimodal Fusion for Unified Microservice Incident Management
by: Qian, Wenzhuo, et al.
Published: (2026)
by: Qian, Wenzhuo, et al.
Published: (2026)
Learning-Augmented Algorithms for the Bahncard Problem
by: Zhao, Hailiang, et al.
Published: (2024)
by: Zhao, Hailiang, et al.
Published: (2024)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
by: Li, Ziying, et al.
Published: (2025)
by: Li, Ziying, et al.
Published: (2025)
GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing
by: Zhao, Xinkui, et al.
Published: (2026)
by: Zhao, Xinkui, et al.
Published: (2026)
Revisiting Vulnerability Patch Localization: An Empirical Study and LLM-Based Solution
by: Xu, Haoran, et al.
Published: (2025)
by: Xu, Haoran, et al.
Published: (2025)
Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey
by: Chen, Chen, et al.
Published: (2024)
by: Chen, Chen, et al.
Published: (2024)
HORAE: A Domain-Agnostic Language for Automated Service Regulation
by: Sun, Yutao, et al.
Published: (2024)
by: Sun, Yutao, et al.
Published: (2024)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
by: Shen, Haozhan, et al.
Published: (2026)
by: Shen, Haozhan, et al.
Published: (2026)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
by: Zhong, Jianping, et al.
Published: (2026)
by: Zhong, Jianping, et al.
Published: (2026)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
by: Zhang, Zilun, et al.
Published: (2025)
by: Zhang, Zilun, et al.
Published: (2025)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
by: Li, Mengke, et al.
Published: (2023)
by: Li, Mengke, et al.
Published: (2023)
OmniFuser: Adaptive Multimodal Fusion for Service-Oriented Predictive Maintenance
by: Wang, Ziqi, et al.
Published: (2025)
by: Wang, Ziqi, et al.
Published: (2025)
Towards Optimal Robustness in Learning-Augmented Paging
by: Chen, Peng, et al.
Published: (2026)
by: Chen, Peng, et al.
Published: (2026)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
by: Zhao, Chen, et al.
Published: (2025)
by: Zhao, Chen, et al.
Published: (2025)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
by: Ni, Shuo, et al.
Published: (2026)
by: Ni, Shuo, et al.
Published: (2026)
ChatUniTest: A Framework for LLM-Based Test Generation
by: Chen, Yinghao, et al.
Published: (2023)
by: Chen, Yinghao, et al.
Published: (2023)
Is Collaboration Worth It? A Decision-Oriented Survey in Multi-Agent Systems
by: Cheng, Guanjie, et al.
Published: (2026)
by: Cheng, Guanjie, et al.
Published: (2026)
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
by: Zhang, Yifan, et al.
Published: (2026)
by: Zhang, Yifan, et al.
Published: (2026)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
by: Zhao, Xinkui, et al.
Published: (2025)
by: Zhao, Xinkui, et al.
Published: (2025)
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
Non-Primary Channel Access in IEEE 802.11 UHR: Comprehensive Analysis and Evaluation
by: Wei, Dongyu, et al.
Published: (2024)
by: Wei, Dongyu, et al.
Published: (2024)
PeerSync: Accelerating Containerized Service Delivery at the Network Edge
by: Deng, Yinuo, et al.
Published: (2025)
by: Deng, Yinuo, et al.
Published: (2025)
LUCF-Net: Lightweight U-shaped Cascade Fusion Network for Medical Image Segmentation
by: Sun, Songkai, et al.
Published: (2024)
by: Sun, Songkai, et al.
Published: (2024)
Advanced Computational Approaches for Multimodal Fusion in Mass Spectrometry Imaging
by: Lei Guo
Published: (2025)
by: Lei Guo
Published: (2025)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
by: Cheng, Guanjie, et al.
Published: (2026)
by: Cheng, Guanjie, et al.
Published: (2026)
Similar Items
-
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
by: Zhang, Zilun, et al.
Published: (2023) -
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
by: Zhang, Zilun, et al.
Published: (2024) -
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
by: Zhang, Zilun, et al.
Published: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
by: Shen, Haozhan, et al.
Published: (2024) -
DetailCLIP: Injecting Image Details into CLIP's Feature Space
by: Zhang, Zilun, et al.
Published: (2022)