UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Ni, Shuo, Wang, Tong, Zhang, Jing, Chen, He, Guo, Haonan, Zhang, Ning, Du, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
di: Ni, Shuo, et al.
Pubblicazione: (2025)
di: Ni, Shuo, et al.
Pubblicazione: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
di: Guo, Hao, et al.
Pubblicazione: (2026)
di: Guo, Hao, et al.
Pubblicazione: (2026)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery
di: Li, Jingfang, et al.
Pubblicazione: (2026)
di: Li, Jingfang, et al.
Pubblicazione: (2026)
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
di: Guo, Yulong, et al.
Pubblicazione: (2025)
di: Guo, Yulong, et al.
Pubblicazione: (2025)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
di: Shi, Chufan, et al.
Pubblicazione: (2026)
di: Shi, Chufan, et al.
Pubblicazione: (2026)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
di: Sun, Xiaoxiao, et al.
Pubblicazione: (2026)
di: Sun, Xiaoxiao, et al.
Pubblicazione: (2026)
DGSolver: Diffusion Generalist Solver with Universal Posterior Sampling for Image Restoration
di: Wang, Hebaixu, et al.
Pubblicazione: (2025)
di: Wang, Hebaixu, et al.
Pubblicazione: (2025)
NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics
di: Lan, Jian, et al.
Pubblicazione: (2026)
di: Lan, Jian, et al.
Pubblicazione: (2026)
Residual Diffusion Bridge Model for Image Restoration
di: Wang, Hebaixu, et al.
Pubblicazione: (2025)
di: Wang, Hebaixu, et al.
Pubblicazione: (2025)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
Universal Pansharpening Foundation Model
di: Wang, Hebaixu, et al.
Pubblicazione: (2026)
di: Wang, Hebaixu, et al.
Pubblicazione: (2026)
SAAN: Similarity-aware attention flow network for change detection with VHR remote sensing images
di: Guo, Haonan, et al.
Pubblicazione: (2023)
di: Guo, Haonan, et al.
Pubblicazione: (2023)
UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
EarthNets: Empowering AI in Earth Observation
di: Xiong, Zhitong, et al.
Pubblicazione: (2022)
di: Xiong, Zhitong, et al.
Pubblicazione: (2022)
RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation
di: Houdré, Nicolas, et al.
Pubblicazione: (2025)
di: Houdré, Nicolas, et al.
Pubblicazione: (2025)
UHR-Net: An Uncertainty-Aware Hypergraph Refinement Network for Medical Image Segmentation
di: Cheng, Shuokun, et al.
Pubblicazione: (2026)
di: Cheng, Shuokun, et al.
Pubblicazione: (2026)
Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents
di: Feng, Peilin, et al.
Pubblicazione: (2025)
di: Feng, Peilin, et al.
Pubblicazione: (2025)
Still Camouflage, Moving Illusion: View-Induced Trajectory Manipulation in Autonomous Driving
di: Ju, Shuo, et al.
Pubblicazione: (2026)
di: Ju, Shuo, et al.
Pubblicazione: (2026)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
di: Li, Sifan, et al.
Pubblicazione: (2025)
di: Li, Sifan, et al.
Pubblicazione: (2025)
Deep Pre-Alignment for VLMs
di: Yu, Tianyu, et al.
Pubblicazione: (2026)
di: Yu, Tianyu, et al.
Pubblicazione: (2026)
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
di: Zhao, Chen, et al.
Pubblicazione: (2025)
di: Zhao, Chen, et al.
Pubblicazione: (2025)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
di: Guo, Haonan, et al.
Pubblicazione: (2024)
di: Guo, Haonan, et al.
Pubblicazione: (2024)
GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization
di: Song, Zixuan, et al.
Pubblicazione: (2025)
di: Song, Zixuan, et al.
Pubblicazione: (2025)
Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
RemoteSAM: Towards Segment Anything for Earth Observation
di: Yao, Liang, et al.
Pubblicazione: (2025)
di: Yao, Liang, et al.
Pubblicazione: (2025)
Expediting Building Footprint Extraction from High-resolution Remote Sensing Images via progressive lenient supervision
di: Guo, Haonan, et al.
Pubblicazione: (2023)
di: Guo, Haonan, et al.
Pubblicazione: (2023)
Building-road Collaborative Extraction from Remotely Sensed Images via Cross-Interaction
di: Guo, Haonan, et al.
Pubblicazione: (2023)
di: Guo, Haonan, et al.
Pubblicazione: (2023)
AnySat: One Earth Observation Model for Many Resolutions, Scales, and Modalities
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
di: Guo, Xin, et al.
Pubblicazione: (2023)
di: Guo, Xin, et al.
Pubblicazione: (2023)
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
di: Lu, Shuai, et al.
Pubblicazione: (2026)
di: Lu, Shuai, et al.
Pubblicazione: (2026)
Do VLMs Have Bad Eyes? Diagnosing Compositional Failures via Mechanistic Interpretability
di: Aravindan, Ashwath Vaithinathan, et al.
Pubblicazione: (2025)
di: Aravindan, Ashwath Vaithinathan, et al.
Pubblicazione: (2025)
Any2Any: Unified Arbitrary Modality Translation for Remote Sensing
di: Chen, Haoyang, et al.
Pubblicazione: (2026)
di: Chen, Haoyang, et al.
Pubblicazione: (2026)
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
di: Zha, Junli, et al.
Pubblicazione: (2026)
di: Zha, Junli, et al.
Pubblicazione: (2026)
OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation
di: Zhao, Sijie, et al.
Pubblicazione: (2026)
di: Zhao, Sijie, et al.
Pubblicazione: (2026)
EarthSynth: Generating Informative Earth Observation with Diffusion Models
di: Pan, Jiancheng, et al.
Pubblicazione: (2025)
di: Pan, Jiancheng, et al.
Pubblicazione: (2025)
CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
di: Tian, Baoliang, et al.
Pubblicazione: (2025)
di: Tian, Baoliang, et al.
Pubblicazione: (2025)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
di: Jiang, Bo, et al.
Pubblicazione: (2025)
di: Jiang, Bo, et al.
Pubblicazione: (2025)
EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
di: Zhang, Wanyue, et al.
Pubblicazione: (2026)
di: Zhang, Wanyue, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
di: Ni, Shuo, et al.
Pubblicazione: (2025) -
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
di: Guo, Hao, et al.
Pubblicazione: (2026) -
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
di: Liu, Yi, et al.
Pubblicazione: (2026) -
UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery
di: Li, Jingfang, et al.
Pubblicazione: (2026) -
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
di: Guo, Yulong, et al.
Pubblicazione: (2025)