SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Guo, Yulong, Zhang, Zilun, Shang, Yongheng, Zhao, Tiancheng, Deng, Shuiguang, Yang, Yingchun, Yin, Jianwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2023)
von: Zhang, Zilun, et al.
Veröffentlicht: (2023)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
von: Shen, Haozhan, et al.
Veröffentlicht: (2024)
von: Shen, Haozhan, et al.
Veröffentlicht: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
von: Zhang, Zilun, et al.
Veröffentlicht: (2022)
von: Zhang, Zilun, et al.
Veröffentlicht: (2022)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
von: Zhao, Hailiang, et al.
Veröffentlicht: (2024)
von: Zhao, Hailiang, et al.
Veröffentlicht: (2024)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
Tail-Aware Data Augmentation for Long-Tail Sequential Recommendation
von: Dang, Yizhou, et al.
Veröffentlicht: (2026)
von: Dang, Yizhou, et al.
Veröffentlicht: (2026)
GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion
von: Wang, Xingliang, et al.
Veröffentlicht: (2025)
von: Wang, Xingliang, et al.
Veröffentlicht: (2025)
UHR-Net: An Uncertainty-Aware Hypergraph Refinement Network for Medical Image Segmentation
von: Cheng, Shuokun, et al.
Veröffentlicht: (2026)
von: Cheng, Shuokun, et al.
Veröffentlicht: (2026)
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
von: Zhao, Xinkui, et al.
Veröffentlicht: (2025)
von: Zhao, Xinkui, et al.
Veröffentlicht: (2025)
XFMNet: Decoding Cross-Site and Nonstationary Water Patterns via Stepwise Multimodal Fusion for Long-Term Water Quality Forecasting
von: Wang, Ziqi, et al.
Veröffentlicht: (2025)
von: Wang, Ziqi, et al.
Veröffentlicht: (2025)
Talking to Yourself: Defying Forgetting in Large Language Models
von: Sun, Yutao, et al.
Veröffentlicht: (2026)
von: Sun, Yutao, et al.
Veröffentlicht: (2026)
SatFusion: A Unified Framework for Enhancing Remote Sensing Images via Multi-Frame and Multi-Source Images Fusion
von: Tong, Yufei, et al.
Veröffentlicht: (2025)
von: Tong, Yufei, et al.
Veröffentlicht: (2025)
Missing-Aware Multimodal Fusion for Unified Microservice Incident Management
von: Qian, Wenzhuo, et al.
Veröffentlicht: (2026)
von: Qian, Wenzhuo, et al.
Veröffentlicht: (2026)
Learning-Augmented Algorithms for the Bahncard Problem
von: Zhao, Hailiang, et al.
Veröffentlicht: (2024)
von: Zhao, Hailiang, et al.
Veröffentlicht: (2024)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
von: Li, Ziying, et al.
Veröffentlicht: (2025)
von: Li, Ziying, et al.
Veröffentlicht: (2025)
GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing
von: Zhao, Xinkui, et al.
Veröffentlicht: (2026)
von: Zhao, Xinkui, et al.
Veröffentlicht: (2026)
Revisiting Vulnerability Patch Localization: An Empirical Study and LLM-Based Solution
von: Xu, Haoran, et al.
Veröffentlicht: (2025)
von: Xu, Haoran, et al.
Veröffentlicht: (2025)
Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey
von: Chen, Chen, et al.
Veröffentlicht: (2024)
von: Chen, Chen, et al.
Veröffentlicht: (2024)
HORAE: A Domain-Agnostic Language for Automated Service Regulation
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
von: Shen, Haozhan, et al.
Veröffentlicht: (2026)
von: Shen, Haozhan, et al.
Veröffentlicht: (2026)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
von: Zhong, Jianping, et al.
Veröffentlicht: (2026)
von: Zhong, Jianping, et al.
Veröffentlicht: (2026)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
von: Li, Mengke, et al.
Veröffentlicht: (2023)
von: Li, Mengke, et al.
Veröffentlicht: (2023)
OmniFuser: Adaptive Multimodal Fusion for Service-Oriented Predictive Maintenance
von: Wang, Ziqi, et al.
Veröffentlicht: (2025)
von: Wang, Ziqi, et al.
Veröffentlicht: (2025)
Towards Optimal Robustness in Learning-Augmented Paging
von: Chen, Peng, et al.
Veröffentlicht: (2026)
von: Chen, Peng, et al.
Veröffentlicht: (2026)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
von: Zhao, Chen, et al.
Veröffentlicht: (2025)
von: Zhao, Chen, et al.
Veröffentlicht: (2025)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
von: Ni, Shuo, et al.
Veröffentlicht: (2026)
von: Ni, Shuo, et al.
Veröffentlicht: (2026)
ChatUniTest: A Framework for LLM-Based Test Generation
von: Chen, Yinghao, et al.
Veröffentlicht: (2023)
von: Chen, Yinghao, et al.
Veröffentlicht: (2023)
Is Collaboration Worth It? A Decision-Oriented Survey in Multi-Agent Systems
von: Cheng, Guanjie, et al.
Veröffentlicht: (2026)
von: Cheng, Guanjie, et al.
Veröffentlicht: (2026)
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
von: Zhang, Yifan, et al.
Veröffentlicht: (2026)
von: Zhang, Yifan, et al.
Veröffentlicht: (2026)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
von: Zhao, Xinkui, et al.
Veröffentlicht: (2025)
von: Zhao, Xinkui, et al.
Veröffentlicht: (2025)
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Non-Primary Channel Access in IEEE 802.11 UHR: Comprehensive Analysis and Evaluation
von: Wei, Dongyu, et al.
Veröffentlicht: (2024)
von: Wei, Dongyu, et al.
Veröffentlicht: (2024)
PeerSync: Accelerating Containerized Service Delivery at the Network Edge
von: Deng, Yinuo, et al.
Veröffentlicht: (2025)
von: Deng, Yinuo, et al.
Veröffentlicht: (2025)
LUCF-Net: Lightweight U-shaped Cascade Fusion Network for Medical Image Segmentation
von: Sun, Songkai, et al.
Veröffentlicht: (2024)
von: Sun, Songkai, et al.
Veröffentlicht: (2024)
Advanced Computational Approaches for Multimodal Fusion in Mass Spectrometry Imaging
von: Lei Guo
Veröffentlicht: (2025)
von: Lei Guo
Veröffentlicht: (2025)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
von: Cheng, Guanjie, et al.
Veröffentlicht: (2026)
von: Cheng, Guanjie, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2023) -
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
von: Zhang, Zilun, et al.
Veröffentlicht: (2024) -
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
von: Shen, Haozhan, et al.
Veröffentlicht: (2024) -
DetailCLIP: Injecting Image Details into CLIP's Feature Space
von: Zhang, Zilun, et al.
Veröffentlicht: (2022)