Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Xuan, Guan, Dayan, Gu, Yanfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025)
por: Shen, Xiaoqian, et al.
Publicado: (2025)
Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming
por: Erzurumlu, Yunus Talha, et al.
Publicado: (2026)
por: Erzurumlu, Yunus Talha, et al.
Publicado: (2026)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
por: Luan, Bozhi, et al.
Publicado: (2024)
por: Luan, Bozhi, et al.
Publicado: (2024)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
por: Shen, Haozhan, et al.
Publicado: (2024)
por: Shen, Haozhan, et al.
Publicado: (2024)
AttZoom: Attention Zoom for Better Visual Features
por: DeAlcala, Daniel, et al.
Publicado: (2025)
por: DeAlcala, Daniel, et al.
Publicado: (2025)
Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
por: Wei, Lai, et al.
Publicado: (2026)
por: Wei, Lai, et al.
Publicado: (2026)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
por: Liu, Ruixun, et al.
Publicado: (2025)
por: Liu, Ruixun, et al.
Publicado: (2025)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
por: Liu, Xianjie, et al.
Publicado: (2025)
por: Liu, Xianjie, et al.
Publicado: (2025)
Self-Supervised Learning for Real-World Super-Resolution from Dual and Multiple Zoomed Observations
por: Zhang, Zhilu, et al.
Publicado: (2024)
por: Zhang, Zhilu, et al.
Publicado: (2024)
Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception
por: Yang, Jiashu, et al.
Publicado: (2025)
por: Yang, Jiashu, et al.
Publicado: (2025)
GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance
por: Shi, Jiale, et al.
Publicado: (2026)
por: Shi, Jiale, et al.
Publicado: (2026)
Dual-Camera Smooth Zoom on Mobile Phones
por: Wu, Renlong, et al.
Publicado: (2024)
por: Wu, Renlong, et al.
Publicado: (2024)
Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
por: Jiang, Zhiyuan, et al.
Publicado: (2025)
por: Jiang, Zhiyuan, et al.
Publicado: (2025)
PTZ-Calib: Robust Pan-Tilt-Zoom Camera Calibration
por: Guo, Jinhui, et al.
Publicado: (2025)
por: Guo, Jinhui, et al.
Publicado: (2025)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
por: Guo, Jiayi, et al.
Publicado: (2026)
por: Guo, Jiayi, et al.
Publicado: (2026)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
por: Li, Chenglin, et al.
Publicado: (2025)
por: Li, Chenglin, et al.
Publicado: (2025)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024)
por: Thapa, Rahul, et al.
Publicado: (2024)
Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization
por: Shihab, Ibne Farabi, et al.
Publicado: (2025)
por: Shihab, Ibne Farabi, et al.
Publicado: (2025)
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
por: Zhou, Dewei, et al.
Publicado: (2026)
por: Zhou, Dewei, et al.
Publicado: (2026)
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
por: Kim, Bryan Sangwoo, et al.
Publicado: (2025)
por: Kim, Bryan Sangwoo, et al.
Publicado: (2025)
Zoom and Shift are All You Need
por: Qin, Jiahao
Publicado: (2024)
por: Qin, Jiahao
Publicado: (2024)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
Boosting Point-supervised Temporal Action Localization via Text Refinement and Alignment
por: Ma, Yunchuan, et al.
Publicado: (2026)
por: Ma, Yunchuan, et al.
Publicado: (2026)
UltraZoom: Generating Gigapixel Images from Regular Photos
por: Ma, Jingwei, et al.
Publicado: (2025)
por: Ma, Jingwei, et al.
Publicado: (2025)
Efficient Hybrid Zoom using Camera Fusion on Mobile Phones
por: Wu, Xiaotong, et al.
Publicado: (2024)
por: Wu, Xiaotong, et al.
Publicado: (2024)
ATAC-Net: Zoomed view works better for Anomaly Detection
por: Gupta, Shaurya, et al.
Publicado: (2024)
por: Gupta, Shaurya, et al.
Publicado: (2024)
SpectralZoom: Efficient Segmentation with an Adaptive Hyperspectral Camera
por: Arnold, Jackson, et al.
Publicado: (2024)
por: Arnold, Jackson, et al.
Publicado: (2024)
Seeing the Unseen: Zooming in the Dark with Event Cameras
por: Kai, Dachun, et al.
Publicado: (2026)
por: Kai, Dachun, et al.
Publicado: (2026)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
por: Zhang, Xintong, et al.
Publicado: (2025)
por: Zhang, Xintong, et al.
Publicado: (2025)
Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification Approach
por: Cai, Lvpan, et al.
Publicado: (2025)
por: Cai, Lvpan, et al.
Publicado: (2025)
Adaptive Image Zoom-in with Bounding Box Transformation for UAV Object Detection
por: Wang, Tao, et al.
Publicado: (2026)
por: Wang, Tao, et al.
Publicado: (2026)
Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning
por: Liang, Guoqiang, et al.
Publicado: (2026)
por: Liang, Guoqiang, et al.
Publicado: (2026)
ZoomLDM: Latent Diffusion Model for multi-scale image generation
por: Yellapragada, Srikar, et al.
Publicado: (2024)
por: Yellapragada, Srikar, et al.
Publicado: (2024)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
por: Shi, Yuheng, et al.
Publicado: (2026)
por: Shi, Yuheng, et al.
Publicado: (2026)
Sparse Refinement for Efficient High-Resolution Semantic Segmentation
por: Liu, Zhijian, et al.
Publicado: (2024)
por: Liu, Zhijian, et al.
Publicado: (2024)
Zoomed In, Diffused Out: Towards Local Degradation-Aware Multi-Diffusion for Extreme Image Super-Resolution
por: Moser, Brian B., et al.
Publicado: (2024)
por: Moser, Brian B., et al.
Publicado: (2024)
WonderZoom: Multi-Scale 3D World Generation
por: Cao, Jin, et al.
Publicado: (2025)
por: Cao, Jin, et al.
Publicado: (2025)
OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
por: Liu, Yaoli, et al.
Publicado: (2025)
por: Liu, Yaoli, et al.
Publicado: (2025)
Ejemplares similares
-
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026) -
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025) -
Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming
por: Erzurumlu, Yunus Talha, et al.
Publicado: (2026) -
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
por: Luan, Bozhi, et al.
Publicado: (2024) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
por: Shen, Haozhan, et al.
Publicado: (2024)