Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Thapa, Rahul, Chen, Kezhen, Covert, Ian, Chalamala, Rahul, Athiwaratkun, Ben, Song, Shuaiwen Leon, Zou, James |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
por: Li, Andrew, et al.
Publicado: (2025)
por: Li, Andrew, et al.
Publicado: (2025)
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
por: Thapa, Rahul, et al.
Publicado: (2025)
por: Thapa, Rahul, et al.
Publicado: (2025)
Locality Alignment Improves Vision-Language Models
por: Covert, Ian, et al.
Publicado: (2024)
por: Covert, Ian, et al.
Publicado: (2024)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
por: Liu, Ruixun, et al.
Publicado: (2025)
por: Liu, Ruixun, et al.
Publicado: (2025)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
por: Zhu, Fengbin, et al.
Publicado: (2026)
por: Zhu, Fengbin, et al.
Publicado: (2026)
A PCA based Keypoint Tracking Approach to Automated Facial Expressions Encoding
por: Tripathi, Shivansh Chandra, et al.
Publicado: (2024)
por: Tripathi, Shivansh Chandra, et al.
Publicado: (2024)
Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement
por: Yu, Xuan, et al.
Publicado: (2025)
por: Yu, Xuan, et al.
Publicado: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
por: Huang, Jie, et al.
Publicado: (2025)
por: Huang, Jie, et al.
Publicado: (2025)
CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models
por: Anand, Neeraj, et al.
Publicado: (2026)
por: Anand, Neeraj, et al.
Publicado: (2026)
MicroVision: An Open Dataset and Benchmark Models for Detecting Vulnerable Road Users and Micromobility Vehicles
por: Rasch, Alexander, et al.
Publicado: (2026)
por: Rasch, Alexander, et al.
Publicado: (2026)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
por: Unmesh, Asim, et al.
Publicado: (2026)
por: Unmesh, Asim, et al.
Publicado: (2026)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
por: Liu, Xianjie, et al.
Publicado: (2025)
por: Liu, Xianjie, et al.
Publicado: (2025)
A Review of 3D Object Detection with Vision-Language Models
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Explanation-Aware Learning for Enhanced Interpretability in Biomedical Imaging
por: Faruqui, Zubair, et al.
Publicado: (2026)
por: Faruqui, Zubair, et al.
Publicado: (2026)
EventZoom: A Progressive Approach to Event-Based Data Augmentation for Enhanced Neuromorphic Vision
por: Dong, Yiting, et al.
Publicado: (2024)
por: Dong, Yiting, et al.
Publicado: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
por: Lu, Jiaying, et al.
Publicado: (2023)
por: Lu, Jiaying, et al.
Publicado: (2023)
Interpreting Neurons in Deep Vision Networks with Language Models
por: Bai, Nicholas, et al.
Publicado: (2024)
por: Bai, Nicholas, et al.
Publicado: (2024)
Temporal-Anchor3DLane: Enhanced 3D Lane Detection with Multi-Task Losses and LSTM Fusion
por: Suhas, D. Shainu, et al.
Publicado: (2025)
por: Suhas, D. Shainu, et al.
Publicado: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
por: Shen, Haozhan, et al.
Publicado: (2024)
por: Shen, Haozhan, et al.
Publicado: (2024)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
por: Lu, Pan, et al.
Publicado: (2025)
por: Lu, Pan, et al.
Publicado: (2025)
Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
por: Zhang, Yunkai, et al.
Publicado: (2026)
por: Zhang, Yunkai, et al.
Publicado: (2026)
Computer Vision based Automated Quantification of Agricultural Sprayers Boom Displacement
por: Dalal, Aryan Singh, et al.
Publicado: (2025)
por: Dalal, Aryan Singh, et al.
Publicado: (2025)
Characterizing and Optimizing the Spatial Kernel of Multi Resolution Hash Encodings
por: Dai, Tianxiang, et al.
Publicado: (2026)
por: Dai, Tianxiang, et al.
Publicado: (2026)
Identifying and Mitigating Position Bias of Multi-image Vision-Language Models
por: Tian, Xinyu, et al.
Publicado: (2025)
por: Tian, Xinyu, et al.
Publicado: (2025)
MZEN: Multi-Zoom Enhanced NeRF for 3-D Reconstruction with Unknown Camera Poses
por: Park, Jong-Ik, et al.
Publicado: (2025)
por: Park, Jong-Ik, et al.
Publicado: (2025)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
por: Chen, Yule, et al.
Publicado: (2025)
por: Chen, Yule, et al.
Publicado: (2025)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
por: Tong, Baoshun, et al.
Publicado: (2024)
por: Tong, Baoshun, et al.
Publicado: (2024)
Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
por: KV, Karthikeya
Publicado: (2025)
por: KV, Karthikeya
Publicado: (2025)
DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models
por: Zhou, Xirui, et al.
Publicado: (2025)
por: Zhou, Xirui, et al.
Publicado: (2025)
On Evaluation of Vision Datasets and Models using Human Competency Frameworks
por: Ramachandran, Rahul, et al.
Publicado: (2024)
por: Ramachandran, Rahul, et al.
Publicado: (2024)
ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection
por: Lu, Hong, et al.
Publicado: (2025)
por: Lu, Hong, et al.
Publicado: (2025)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
por: Li, Lulin, et al.
Publicado: (2024)
por: Li, Lulin, et al.
Publicado: (2024)
OSSCAR: One-Shot Structured Pruning in Vision and Language Models with Combinatorial Optimization
por: Meng, Xiang, et al.
Publicado: (2024)
por: Meng, Xiang, et al.
Publicado: (2024)
SeG-SR: Integrating Semantic Knowledge into Remote Sensing Image Super-Resolution via Vision-Language Model
por: Chen, Bowen, et al.
Publicado: (2025)
por: Chen, Bowen, et al.
Publicado: (2025)
Self-Supervised Learning for Real-World Super-Resolution from Dual and Multiple Zoomed Observations
por: Zhang, Zhilu, et al.
Publicado: (2024)
por: Zhang, Zhilu, et al.
Publicado: (2024)
Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
por: Xu, Wei
Publicado: (2026)
por: Xu, Wei
Publicado: (2026)
From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
por: Yuan, Kun, et al.
Publicado: (2025)
por: Yuan, Kun, et al.
Publicado: (2025)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025)
por: Shen, Xiaoqian, et al.
Publicado: (2025)
Ejemplares similares
-
SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
por: Li, Andrew, et al.
Publicado: (2025) -
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
por: Thapa, Rahul, et al.
Publicado: (2025) -
Locality Alignment Improves Vision-Language Models
por: Covert, Ian, et al.
Publicado: (2024) -
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
por: Liu, Ruixun, et al.
Publicado: (2025) -
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
por: Zhu, Fengbin, et al.
Publicado: (2026)