UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
Fuente:
arXiv
Guardado en:
| Autores principales: | Dang, Yunkai, Dai, Minxin, Yang, Yuekun, Li, Zhangnan, Li, Wenbin, Miao, Feng, Gao, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery
por: Li, Jingfang, et al.
Publicado: (2026)
por: Li, Jingfang, et al.
Publicado: (2026)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
por: Yang, Jiacheng, et al.
Publicado: (2026)
por: Yang, Jiacheng, et al.
Publicado: (2026)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
por: Dang, Yunkai, et al.
Publicado: (2026)
por: Dang, Yunkai, et al.
Publicado: (2026)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
por: Li, Yueying, et al.
Publicado: (2026)
por: Li, Yueying, et al.
Publicado: (2026)
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
por: Dang, Yunkai, et al.
Publicado: (2026)
por: Dang, Yunkai, et al.
Publicado: (2026)
Beyond Token Eviction: Mixed-Dimension Budget Allocation for Efficient KV Cache Compression
por: Miao, Ruijie, et al.
Publicado: (2026)
por: Miao, Ruijie, et al.
Publicado: (2026)
Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
Ultra-Low Complexity On-Orbit Compression for Remote Sensing Imagery via Block Modulated Imaging
por: Wang, Zhibin, et al.
Publicado: (2024)
por: Wang, Zhibin, et al.
Publicado: (2024)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
por: Zhao, Chen, et al.
Publicado: (2025)
por: Zhao, Chen, et al.
Publicado: (2025)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026)
por: Zhu, Jiashun, et al.
Publicado: (2026)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
por: Ni, Shuo, et al.
Publicado: (2026)
por: Ni, Shuo, et al.
Publicado: (2026)
Diffusion Enhancement for Cloud Removal in Ultra-Resolution Remote Sensing Imagery
por: Sui, Jialu, et al.
Publicado: (2024)
por: Sui, Jialu, et al.
Publicado: (2024)
Governance-Aware Hybrid Fine-Tuning for Multilingual Large Language Models
por: Qi, Haomin, et al.
Publicado: (2025)
por: Qi, Haomin, et al.
Publicado: (2025)
Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models
por: Li, Zihan, et al.
Publicado: (2025)
por: Li, Zihan, et al.
Publicado: (2025)
Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping
por: Lyu, Jienan, et al.
Publicado: (2026)
por: Lyu, Jienan, et al.
Publicado: (2026)
F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentation
por: Chen, Hengzhi, et al.
Publicado: (2025)
por: Chen, Hengzhi, et al.
Publicado: (2025)
3D Human Face Reconstruction with 3DMM face model from RGB image
por: Jiang, Zhangnan, et al.
Publicado: (2026)
por: Jiang, Zhangnan, et al.
Publicado: (2026)
Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
Remote Sensing with High Spatial Resolution
por: Sandmann, André, et al.
Publicado: (2024)
por: Sandmann, André, et al.
Publicado: (2024)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
por: Luo, Junwei, et al.
Publicado: (2025)
por: Luo, Junwei, et al.
Publicado: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
por: Yang, Morunliu, et al.
Publicado: (2026)
por: Yang, Morunliu, et al.
Publicado: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens
por: Perron, Yohann, et al.
Publicado: (2026)
por: Perron, Yohann, et al.
Publicado: (2026)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
por: Lu, Hongyu, et al.
Publicado: (2026)
por: Lu, Hongyu, et al.
Publicado: (2026)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
por: Yao, Kelu, et al.
Publicado: (2025)
por: Yao, Kelu, et al.
Publicado: (2025)
UHR-Net: An Uncertainty-Aware Hypergraph Refinement Network for Medical Image Segmentation
por: Cheng, Shuokun, et al.
Publicado: (2026)
por: Cheng, Shuokun, et al.
Publicado: (2026)
Hausdorff dimension of recurrence sets for matrix transformations of tori
por: Hu, Zhangnan, et al.
Publicado: (2024)
por: Hu, Zhangnan, et al.
Publicado: (2024)
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
por: Du, Junhao, et al.
Publicado: (2026)
por: Du, Junhao, et al.
Publicado: (2026)
Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing
por: Adler, Mathis Jürgen, et al.
Publicado: (2025)
por: Adler, Mathis Jürgen, et al.
Publicado: (2025)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
por: Liang, Yuxuan, et al.
Publicado: (2025)
por: Liang, Yuxuan, et al.
Publicado: (2025)
SeG-SR: Integrating Semantic Knowledge into Remote Sensing Image Super-Resolution via Vision-Language Model
por: Chen, Bowen, et al.
Publicado: (2025)
por: Chen, Bowen, et al.
Publicado: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
por: Li, Xu, et al.
Publicado: (2025)
por: Li, Xu, et al.
Publicado: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
por: Cao, Sihan, et al.
Publicado: (2026)
por: Cao, Sihan, et al.
Publicado: (2026)
A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning
por: Zhou, Qing, et al.
Publicado: (2025)
por: Zhou, Qing, et al.
Publicado: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
por: Zhang, Zilun, et al.
Publicado: (2024)
por: Zhang, Zilun, et al.
Publicado: (2024)
FSG-Net: Frequency-Spatial Synergistic Gated Network for High-Resolution Remote Sensing Change Detection
por: Xie, Zhongxiang, et al.
Publicado: (2025)
por: Xie, Zhongxiang, et al.
Publicado: (2025)
Ejemplares similares
-
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
por: Dang, Yunkai, et al.
Publicado: (2025) -
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025) -
UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery
por: Li, Jingfang, et al.
Publicado: (2026) -
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
por: Yang, Jiacheng, et al.
Publicado: (2026) -
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
por: Dang, Yunkai, et al.
Publicado: (2026)