Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Thapa, Rahul, Chen, Kezhen, Covert, Ian, Chalamala, Rahul, Athiwaratkun, Ben, Song, Shuaiwen Leon, Zou, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
di: Li, Andrew, et al.
Pubblicazione: (2025)
di: Li, Andrew, et al.
Pubblicazione: (2025)
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
di: Thapa, Rahul, et al.
Pubblicazione: (2025)
di: Thapa, Rahul, et al.
Pubblicazione: (2025)
Locality Alignment Improves Vision-Language Models
di: Covert, Ian, et al.
Pubblicazione: (2024)
di: Covert, Ian, et al.
Pubblicazione: (2024)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
di: Zhu, Fengbin, et al.
Pubblicazione: (2026)
di: Zhu, Fengbin, et al.
Pubblicazione: (2026)
A PCA based Keypoint Tracking Approach to Automated Facial Expressions Encoding
di: Tripathi, Shivansh Chandra, et al.
Pubblicazione: (2024)
di: Tripathi, Shivansh Chandra, et al.
Pubblicazione: (2024)
Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement
di: Yu, Xuan, et al.
Pubblicazione: (2025)
di: Yu, Xuan, et al.
Pubblicazione: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models
di: Anand, Neeraj, et al.
Pubblicazione: (2026)
di: Anand, Neeraj, et al.
Pubblicazione: (2026)
MicroVision: An Open Dataset and Benchmark Models for Detecting Vulnerable Road Users and Micromobility Vehicles
di: Rasch, Alexander, et al.
Pubblicazione: (2026)
di: Rasch, Alexander, et al.
Pubblicazione: (2026)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
di: Unmesh, Asim, et al.
Pubblicazione: (2026)
di: Unmesh, Asim, et al.
Pubblicazione: (2026)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
di: Liu, Xianjie, et al.
Pubblicazione: (2025)
di: Liu, Xianjie, et al.
Pubblicazione: (2025)
A Review of 3D Object Detection with Vision-Language Models
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
Explanation-Aware Learning for Enhanced Interpretability in Biomedical Imaging
di: Faruqui, Zubair, et al.
Pubblicazione: (2026)
di: Faruqui, Zubair, et al.
Pubblicazione: (2026)
EventZoom: A Progressive Approach to Event-Based Data Augmentation for Enhanced Neuromorphic Vision
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Interpreting Neurons in Deep Vision Networks with Language Models
di: Bai, Nicholas, et al.
Pubblicazione: (2024)
di: Bai, Nicholas, et al.
Pubblicazione: (2024)
Temporal-Anchor3DLane: Enhanced 3D Lane Detection with Multi-Task Losses and LSTM Fusion
di: Suhas, D. Shainu, et al.
Pubblicazione: (2025)
di: Suhas, D. Shainu, et al.
Pubblicazione: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
di: Shen, Haozhan, et al.
Pubblicazione: (2024)
di: Shen, Haozhan, et al.
Pubblicazione: (2024)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
di: Lu, Pan, et al.
Pubblicazione: (2025)
di: Lu, Pan, et al.
Pubblicazione: (2025)
Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
di: Zhang, Yunkai, et al.
Pubblicazione: (2026)
di: Zhang, Yunkai, et al.
Pubblicazione: (2026)
Computer Vision based Automated Quantification of Agricultural Sprayers Boom Displacement
di: Dalal, Aryan Singh, et al.
Pubblicazione: (2025)
di: Dalal, Aryan Singh, et al.
Pubblicazione: (2025)
Characterizing and Optimizing the Spatial Kernel of Multi Resolution Hash Encodings
di: Dai, Tianxiang, et al.
Pubblicazione: (2026)
di: Dai, Tianxiang, et al.
Pubblicazione: (2026)
Identifying and Mitigating Position Bias of Multi-image Vision-Language Models
di: Tian, Xinyu, et al.
Pubblicazione: (2025)
di: Tian, Xinyu, et al.
Pubblicazione: (2025)
MZEN: Multi-Zoom Enhanced NeRF for 3-D Reconstruction with Unknown Camera Poses
di: Park, Jong-Ik, et al.
Pubblicazione: (2025)
di: Park, Jong-Ik, et al.
Pubblicazione: (2025)
Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models
di: Chen, Yule, et al.
Pubblicazione: (2025)
di: Chen, Yule, et al.
Pubblicazione: (2025)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
di: Tong, Baoshun, et al.
Pubblicazione: (2024)
Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
di: KV, Karthikeya
Pubblicazione: (2025)
di: KV, Karthikeya
Pubblicazione: (2025)
DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models
di: Zhou, Xirui, et al.
Pubblicazione: (2025)
di: Zhou, Xirui, et al.
Pubblicazione: (2025)
On Evaluation of Vision Datasets and Models using Human Competency Frameworks
di: Ramachandran, Rahul, et al.
Pubblicazione: (2024)
di: Ramachandran, Rahul, et al.
Pubblicazione: (2024)
ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection
di: Lu, Hong, et al.
Pubblicazione: (2025)
di: Lu, Hong, et al.
Pubblicazione: (2025)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
di: Li, Lulin, et al.
Pubblicazione: (2024)
di: Li, Lulin, et al.
Pubblicazione: (2024)
OSSCAR: One-Shot Structured Pruning in Vision and Language Models with Combinatorial Optimization
di: Meng, Xiang, et al.
Pubblicazione: (2024)
di: Meng, Xiang, et al.
Pubblicazione: (2024)
SeG-SR: Integrating Semantic Knowledge into Remote Sensing Image Super-Resolution via Vision-Language Model
di: Chen, Bowen, et al.
Pubblicazione: (2025)
di: Chen, Bowen, et al.
Pubblicazione: (2025)
Self-Supervised Learning for Real-World Super-Resolution from Dual and Multiple Zoomed Observations
di: Zhang, Zhilu, et al.
Pubblicazione: (2024)
di: Zhang, Zhilu, et al.
Pubblicazione: (2024)
Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
di: Xu, Wei
Pubblicazione: (2026)
di: Xu, Wei
Pubblicazione: (2026)
From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
di: Yuan, Kun, et al.
Pubblicazione: (2025)
di: Yuan, Kun, et al.
Pubblicazione: (2025)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
di: Li, Andrew, et al.
Pubblicazione: (2025) -
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
di: Thapa, Rahul, et al.
Pubblicazione: (2025) -
Locality Alignment Improves Vision-Language Models
di: Covert, Ian, et al.
Pubblicazione: (2024) -
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
di: Liu, Ruixun, et al.
Pubblicazione: (2025) -
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
di: Zhu, Fengbin, et al.
Pubblicazione: (2026)