Saved in:
| Main Authors: | Baek, Ingeol, Chang, Hwan, Ryu, Sunghyun, Lee, Hwanhee |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2505.15865 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
by: Lee, Dong-Jae, et al.
Published: (2026)
by: Lee, Dong-Jae, et al.
Published: (2026)
Gyro-based Neural Single Image Deblurring
by: Yang, Heemin, et al.
Published: (2024)
by: Yang, Heemin, et al.
Published: (2024)
Generalizable Novel-View Synthesis using a Stereo Camera
by: Lee, Haechan, et al.
Published: (2024)
by: Lee, Haechan, et al.
Published: (2024)
UGPNet: Universal Generative Prior for Image Restoration
by: Lee, Hwayoon, et al.
Published: (2023)
by: Lee, Hwayoon, et al.
Published: (2023)
Probing-RAG: Self-Probing to Guide Language Models in Selective Document Retrieval
by: Baek, Ingeol, et al.
Published: (2024)
by: Baek, Ingeol, et al.
Published: (2024)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
by: He, Zhentao, et al.
Published: (2025)
by: He, Zhentao, et al.
Published: (2025)
FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis
by: Jin, Wonjoon, et al.
Published: (2025)
by: Jin, Wonjoon, et al.
Published: (2025)
Pixel-aligned RGB-NIR Stereo Imaging and Dataset for Robot Vision
by: Kim, Jinnyeong, et al.
Published: (2024)
by: Kim, Jinnyeong, et al.
Published: (2024)
Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models
by: Li, Aaron Branson Cigres, et al.
Published: (2026)
by: Li, Aaron Branson Cigres, et al.
Published: (2026)
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
by: Ryu, Koki, et al.
Published: (2026)
by: Ryu, Koki, et al.
Published: (2026)
How Well Can Vision Language Models See Image Details?
by: Gou, Chenhui, et al.
Published: (2024)
by: Gou, Chenhui, et al.
Published: (2024)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
by: Kim, Sohee, et al.
Published: (2025)
by: Kim, Sohee, et al.
Published: (2025)
Towards Scalable Human-aligned Benchmark for Text-guided Image Editing
by: Ryu, Suho, et al.
Published: (2025)
by: Ryu, Suho, et al.
Published: (2025)
Edge-Aware Image Manipulation via Diffusion Models with a Novel Structure-Preservation Loss
by: Gong, Minsu, et al.
Published: (2026)
by: Gong, Minsu, et al.
Published: (2026)
ParamISP: Learned Forward and Inverse ISPs using Camera Parameters
by: Kim, Woohyeok, et al.
Published: (2023)
by: Kim, Woohyeok, et al.
Published: (2023)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
by: Ye, Maoyuan, et al.
Published: (2025)
by: Ye, Maoyuan, et al.
Published: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
by: Chen, Song, et al.
Published: (2025)
by: Chen, Song, et al.
Published: (2025)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
by: Kim, Jinyeong, et al.
Published: (2025)
by: Kim, Jinyeong, et al.
Published: (2025)
Steering Guidance for Personalized Text-to-Image Diffusion Models
by: Park, Sunghyun, et al.
Published: (2025)
by: Park, Sunghyun, et al.
Published: (2025)
Regularized Training with Generated Datasets for Name-Only Transfer of Vision-Language Models
by: Park, Minho, et al.
Published: (2024)
by: Park, Minho, et al.
Published: (2024)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
by: Nigam, Shubham Kumar, et al.
Published: (2025)
by: Nigam, Shubham Kumar, et al.
Published: (2025)
What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models
by: Abdelhamed, Abdelrahman, et al.
Published: (2024)
by: Abdelhamed, Abdelrahman, et al.
Published: (2024)
Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models
by: Sharma, Pranav, et al.
Published: (2025)
by: Sharma, Pranav, et al.
Published: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
by: Xu, Longwei, et al.
Published: (2026)
by: Xu, Longwei, et al.
Published: (2026)
DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data
by: Jin, Wonjoon, et al.
Published: (2026)
by: Jin, Wonjoon, et al.
Published: (2026)
Addressing Text Embedding Leakage in Diffusion-based Image Editing
by: Mun, Sunung, et al.
Published: (2024)
by: Mun, Sunung, et al.
Published: (2024)
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
by: Hwang, Chan Yeong, et al.
Published: (2026)
by: Hwang, Chan Yeong, et al.
Published: (2026)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
by: Vesalainen, Ari, et al.
Published: (2026)
by: Vesalainen, Ari, et al.
Published: (2026)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
by: Mushkani, Rashid
Published: (2025)
by: Mushkani, Rashid
Published: (2025)
Unveiling the Tapestry of Consistency in Large Vision-Language Models
by: Zhang, Yuan, et al.
Published: (2024)
by: Zhang, Yuan, et al.
Published: (2024)
CLIPtone: Unsupervised Learning for Text-based Image Tone Adjustment
by: Lee, Hyeongmin, et al.
Published: (2024)
by: Lee, Hyeongmin, et al.
Published: (2024)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
by: Momayiz, Imane, et al.
Published: (2026)
by: Momayiz, Imane, et al.
Published: (2026)
MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
by: Dai, Shiqi, et al.
Published: (2025)
by: Dai, Shiqi, et al.
Published: (2025)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
by: Taghadouini, Said, et al.
Published: (2026)
by: Taghadouini, Said, et al.
Published: (2026)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
by: Yu, Ya-Qi, et al.
Published: (2024)
by: Yu, Ya-Qi, et al.
Published: (2024)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
by: Huang, Yuhang, et al.
Published: (2024)
by: Huang, Yuhang, et al.
Published: (2024)
ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image Identification
by: Kim, Ga-Eun, et al.
Published: (2023)
by: Kim, Ga-Eun, et al.
Published: (2023)
Event Ellipsometer: Event-based Mueller-Matrix Video Imaging
by: Maeda, Ryota, et al.
Published: (2024)
by: Maeda, Ryota, et al.
Published: (2024)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
by: Zhong, Yufeng, et al.
Published: (2026)
by: Zhong, Yufeng, et al.
Published: (2026)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
by: Lee, Seongyun, et al.
Published: (2024)
by: Lee, Seongyun, et al.
Published: (2024)
Similar Items
-
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
by: Lee, Dong-Jae, et al.
Published: (2026) -
Gyro-based Neural Single Image Deblurring
by: Yang, Heemin, et al.
Published: (2024) -
Generalizable Novel-View Synthesis using a Stereo Camera
by: Lee, Haechan, et al.
Published: (2024) -
UGPNet: Universal Generative Prior for Image Restoration
by: Lee, Hwayoon, et al.
Published: (2023) -
Probing-RAG: Self-Probing to Guide Language Models in Selective Document Retrieval
by: Baek, Ingeol, et al.
Published: (2024)