SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Yulong, Zhang, Zilun, Shang, Yongheng, Zhao, Tiancheng, Deng, Shuiguang, Yang, Yingchun, Yin, Jianwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2023)
por: Zhang, Zilun, et al.
Publicado: (2023)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
por: Zhang, Zilun, et al.
Publicado: (2024)
por: Zhang, Zilun, et al.
Publicado: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2025)
por: Zhang, Zilun, et al.
Publicado: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
por: Shen, Haozhan, et al.
Publicado: (2024)
por: Shen, Haozhan, et al.
Publicado: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
por: Zhang, Zilun, et al.
Publicado: (2022)
por: Zhang, Zilun, et al.
Publicado: (2022)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
por: Sun, Yutao, et al.
Publicado: (2025)
por: Sun, Yutao, et al.
Publicado: (2025)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
por: Zhao, Hailiang, et al.
Publicado: (2024)
por: Zhao, Hailiang, et al.
Publicado: (2024)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
por: Zhang, Zilun, et al.
Publicado: (2024)
por: Zhang, Zilun, et al.
Publicado: (2024)
Tail-Aware Data Augmentation for Long-Tail Sequential Recommendation
por: Dang, Yizhou, et al.
Publicado: (2026)
por: Dang, Yizhou, et al.
Publicado: (2026)
GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion
por: Wang, Xingliang, et al.
Publicado: (2025)
por: Wang, Xingliang, et al.
Publicado: (2025)
UHR-Net: An Uncertainty-Aware Hypergraph Refinement Network for Medical Image Segmentation
por: Cheng, Shuokun, et al.
Publicado: (2026)
por: Cheng, Shuokun, et al.
Publicado: (2026)
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
XFMNet: Decoding Cross-Site and Nonstationary Water Patterns via Stepwise Multimodal Fusion for Long-Term Water Quality Forecasting
por: Wang, Ziqi, et al.
Publicado: (2025)
por: Wang, Ziqi, et al.
Publicado: (2025)
Talking to Yourself: Defying Forgetting in Large Language Models
por: Sun, Yutao, et al.
Publicado: (2026)
por: Sun, Yutao, et al.
Publicado: (2026)
SatFusion: A Unified Framework for Enhancing Remote Sensing Images via Multi-Frame and Multi-Source Images Fusion
por: Tong, Yufei, et al.
Publicado: (2025)
por: Tong, Yufei, et al.
Publicado: (2025)
Missing-Aware Multimodal Fusion for Unified Microservice Incident Management
por: Qian, Wenzhuo, et al.
Publicado: (2026)
por: Qian, Wenzhuo, et al.
Publicado: (2026)
Learning-Augmented Algorithms for the Bahncard Problem
por: Zhao, Hailiang, et al.
Publicado: (2024)
por: Zhao, Hailiang, et al.
Publicado: (2024)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
por: Li, Ziying, et al.
Publicado: (2025)
por: Li, Ziying, et al.
Publicado: (2025)
GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing
por: Zhao, Xinkui, et al.
Publicado: (2026)
por: Zhao, Xinkui, et al.
Publicado: (2026)
Revisiting Vulnerability Patch Localization: An Empirical Study and LLM-Based Solution
por: Xu, Haoran, et al.
Publicado: (2025)
por: Xu, Haoran, et al.
Publicado: (2025)
Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
HORAE: A Domain-Agnostic Language for Automated Service Regulation
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
por: Shen, Haozhan, et al.
Publicado: (2026)
por: Shen, Haozhan, et al.
Publicado: (2026)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
por: Zhong, Jianping, et al.
Publicado: (2026)
por: Zhong, Jianping, et al.
Publicado: (2026)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
por: Zhang, Zilun, et al.
Publicado: (2025)
por: Zhang, Zilun, et al.
Publicado: (2025)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
por: Li, Mengke, et al.
Publicado: (2023)
por: Li, Mengke, et al.
Publicado: (2023)
OmniFuser: Adaptive Multimodal Fusion for Service-Oriented Predictive Maintenance
por: Wang, Ziqi, et al.
Publicado: (2025)
por: Wang, Ziqi, et al.
Publicado: (2025)
Towards Optimal Robustness in Learning-Augmented Paging
por: Chen, Peng, et al.
Publicado: (2026)
por: Chen, Peng, et al.
Publicado: (2026)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
por: Zhao, Chen, et al.
Publicado: (2025)
por: Zhao, Chen, et al.
Publicado: (2025)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
por: Ni, Shuo, et al.
Publicado: (2026)
por: Ni, Shuo, et al.
Publicado: (2026)
ChatUniTest: A Framework for LLM-Based Test Generation
por: Chen, Yinghao, et al.
Publicado: (2023)
por: Chen, Yinghao, et al.
Publicado: (2023)
Is Collaboration Worth It? A Decision-Oriented Survey in Multi-Agent Systems
por: Cheng, Guanjie, et al.
Publicado: (2026)
por: Cheng, Guanjie, et al.
Publicado: (2026)
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
por: Zhang, Yifan, et al.
Publicado: (2026)
por: Zhang, Yifan, et al.
Publicado: (2026)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
Non-Primary Channel Access in IEEE 802.11 UHR: Comprehensive Analysis and Evaluation
por: Wei, Dongyu, et al.
Publicado: (2024)
por: Wei, Dongyu, et al.
Publicado: (2024)
PeerSync: Accelerating Containerized Service Delivery at the Network Edge
por: Deng, Yinuo, et al.
Publicado: (2025)
por: Deng, Yinuo, et al.
Publicado: (2025)
LUCF-Net: Lightweight U-shaped Cascade Fusion Network for Medical Image Segmentation
por: Sun, Songkai, et al.
Publicado: (2024)
por: Sun, Songkai, et al.
Publicado: (2024)
Advanced Computational Approaches for Multimodal Fusion in Mass Spectrometry Imaging
por: Lei Guo
Publicado: (2025)
por: Lei Guo
Publicado: (2025)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
por: Cheng, Guanjie, et al.
Publicado: (2026)
por: Cheng, Guanjie, et al.
Publicado: (2026)
Ejemplares similares
-
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2023) -
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
por: Zhang, Zilun, et al.
Publicado: (2024) -
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
por: Shen, Haozhan, et al.
Publicado: (2024) -
DetailCLIP: Injecting Image Details into CLIP's Feature Space
por: Zhang, Zilun, et al.
Publicado: (2022)