Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
Fuente:
arXiv
Saved in:
| Main Authors: | Nagaonkar, Sankalp, Sharma, Augustya, Choithani, Ashish, Trivedi, Ashutosh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
by: Sharma, Shivam, et al.
Published: (2026)
by: Sharma, Shivam, et al.
Published: (2026)
BadScan: An Architectural Backdoor Attack on Visual State Space Models
by: Deshmukh, Om Suhas, et al.
Published: (2024)
by: Deshmukh, Om Suhas, et al.
Published: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
by: Rajkhowa, Tonmoy, et al.
Published: (2024)
by: Rajkhowa, Tonmoy, et al.
Published: (2024)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
by: Waly, Alhossien, et al.
Published: (2025)
by: Waly, Alhossien, et al.
Published: (2025)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
by: Addepalli, Sravanti, et al.
Published: (2023)
by: Addepalli, Sravanti, et al.
Published: (2023)
Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition
by: Zhou, Bangbang, et al.
Published: (2024)
by: Zhou, Bangbang, et al.
Published: (2024)
LaVPR: Benchmarking Language and Vision for Place Recognition
by: Idan, Ofer, et al.
Published: (2026)
by: Idan, Ofer, et al.
Published: (2026)
Logios : An open source Greek Polytonic Optical Character Recognition system
by: Konstantinos, Perifanos, et al.
Published: (2025)
by: Konstantinos, Perifanos, et al.
Published: (2025)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
by: Wu, Zixuan, et al.
Published: (2024)
by: Wu, Zixuan, et al.
Published: (2024)
Rethinking Genomic Modeling Through Optical Character Recognition
by: Xiang, Hongxin, et al.
Published: (2026)
by: Xiang, Hongxin, et al.
Published: (2026)
LOCR: Location-Guided Transformer for Optical Character Recognition
by: Sun, Yu, et al.
Published: (2024)
by: Sun, Yu, et al.
Published: (2024)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
by: Sharma, Saurav, et al.
Published: (2025)
by: Sharma, Saurav, et al.
Published: (2025)
Nepali Sign Language Characters Recognition: Dataset Development and Deep Learning Approaches
by: Poudel, Birat, et al.
Published: (2025)
by: Poudel, Birat, et al.
Published: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
by: Peng, Jingwei, et al.
Published: (2025)
by: Peng, Jingwei, et al.
Published: (2025)
Words as Geometric Features: Estimating Homography using Optical Character Recognition as Compressed Image Representation
by: Greer, Ross, et al.
Published: (2025)
by: Greer, Ross, et al.
Published: (2025)
Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement
by: Tran, Phat, et al.
Published: (2026)
by: Tran, Phat, et al.
Published: (2026)
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
by: Waseda, Futa, et al.
Published: (2025)
by: Waseda, Futa, et al.
Published: (2025)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
by: Ray, Sourjyadip, et al.
Published: (2024)
by: Ray, Sourjyadip, et al.
Published: (2024)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
by: Darabi, Nastaran, et al.
Published: (2026)
by: Darabi, Nastaran, et al.
Published: (2026)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
by: Hong, Wenyi, et al.
Published: (2025)
by: Hong, Wenyi, et al.
Published: (2025)
Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition
by: Brettmann, Alexander, et al.
Published: (2025)
by: Brettmann, Alexander, et al.
Published: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
by: Chen, Xiuyuan, et al.
Published: (2023)
by: Chen, Xiuyuan, et al.
Published: (2023)
Character Mixing for Video Generation
by: Liao, Tingting, et al.
Published: (2025)
by: Liao, Tingting, et al.
Published: (2025)
Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition
by: Bhatia, Gagan, et al.
Published: (2024)
by: Bhatia, Gagan, et al.
Published: (2024)
The Urban Vision Hackathon Dataset and Models: Towards Image Annotations and Accurate Vision Models for Indian Traffic
by: Sharma, Akash, et al.
Published: (2025)
by: Sharma, Akash, et al.
Published: (2025)
Benchmarking Large Language Models for Handwritten Text Recognition
by: Crosilla, Giorgia, et al.
Published: (2025)
by: Crosilla, Giorgia, et al.
Published: (2025)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
by: Xu, Zhenlin, et al.
Published: (2023)
by: Xu, Zhenlin, et al.
Published: (2023)
Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
by: Wang, Jin, et al.
Published: (2026)
by: Wang, Jin, et al.
Published: (2026)
Shape and Texture Recognition in Large Vision-Language Models
by: Eppel, Sagi, et al.
Published: (2025)
by: Eppel, Sagi, et al.
Published: (2025)
Open-Set Recognition in the Age of Vision-Language Models
by: Miller, Dimity, et al.
Published: (2024)
by: Miller, Dimity, et al.
Published: (2024)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
by: Gopalkrishnan, Akshay, et al.
Published: (2024)
by: Gopalkrishnan, Akshay, et al.
Published: (2024)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
by: Du, Hao, et al.
Published: (2025)
by: Du, Hao, et al.
Published: (2025)
AnimationBench: Are Video Models Good at Character-Centric Animation?
by: Wu, Leyi, et al.
Published: (2026)
by: Wu, Leyi, et al.
Published: (2026)
MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling
by: Men, Yifang, et al.
Published: (2024)
by: Men, Yifang, et al.
Published: (2024)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
by: Sathe, Ashutosh, et al.
Published: (2024)
by: Sathe, Ashutosh, et al.
Published: (2024)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
by: Bharadwaj, Siddhant, et al.
Published: (2026)
by: Bharadwaj, Siddhant, et al.
Published: (2026)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
by: Qiu, Di, et al.
Published: (2024)
by: Qiu, Di, et al.
Published: (2024)
Distilling Vision-Language Models on Millions of Videos
by: Zhao, Yue, et al.
Published: (2024)
by: Zhao, Yue, et al.
Published: (2024)
VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos
by: Li, Kaining, et al.
Published: (2025)
by: Li, Kaining, et al.
Published: (2025)
Similar Items
-
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
by: Sharma, Shivam, et al.
Published: (2026) -
BadScan: An Architectural Backdoor Attack on Visual State Space Models
by: Deshmukh, Om Suhas, et al.
Published: (2024) -
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
by: Rajkhowa, Tonmoy, et al.
Published: (2024) -
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025) -
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
by: Waly, Alhossien, et al.
Published: (2025)