Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Nagaonkar, Sankalp, Sharma, Augustya, Choithani, Ashish, Trivedi, Ashutosh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
por: Sharma, Shivam, et al.
Publicado: (2026)
por: Sharma, Shivam, et al.
Publicado: (2026)
BadScan: An Architectural Backdoor Attack on Visual State Space Models
por: Deshmukh, Om Suhas, et al.
Publicado: (2024)
por: Deshmukh, Om Suhas, et al.
Publicado: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
por: Haq, Ijazul, et al.
Publicado: (2025)
por: Haq, Ijazul, et al.
Publicado: (2025)
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
por: Waly, Alhossien, et al.
Publicado: (2025)
por: Waly, Alhossien, et al.
Publicado: (2025)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
por: Addepalli, Sravanti, et al.
Publicado: (2023)
por: Addepalli, Sravanti, et al.
Publicado: (2023)
Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition
por: Zhou, Bangbang, et al.
Publicado: (2024)
por: Zhou, Bangbang, et al.
Publicado: (2024)
LaVPR: Benchmarking Language and Vision for Place Recognition
por: Idan, Ofer, et al.
Publicado: (2026)
por: Idan, Ofer, et al.
Publicado: (2026)
Logios : An open source Greek Polytonic Optical Character Recognition system
por: Konstantinos, Perifanos, et al.
Publicado: (2025)
por: Konstantinos, Perifanos, et al.
Publicado: (2025)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
por: Wu, Zixuan, et al.
Publicado: (2024)
por: Wu, Zixuan, et al.
Publicado: (2024)
Rethinking Genomic Modeling Through Optical Character Recognition
por: Xiang, Hongxin, et al.
Publicado: (2026)
por: Xiang, Hongxin, et al.
Publicado: (2026)
LOCR: Location-Guided Transformer for Optical Character Recognition
por: Sun, Yu, et al.
Publicado: (2024)
por: Sun, Yu, et al.
Publicado: (2024)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
por: Sharma, Saurav, et al.
Publicado: (2025)
por: Sharma, Saurav, et al.
Publicado: (2025)
Nepali Sign Language Characters Recognition: Dataset Development and Deep Learning Approaches
por: Poudel, Birat, et al.
Publicado: (2025)
por: Poudel, Birat, et al.
Publicado: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
por: Peng, Jingwei, et al.
Publicado: (2025)
por: Peng, Jingwei, et al.
Publicado: (2025)
Words as Geometric Features: Estimating Homography using Optical Character Recognition as Compressed Image Representation
por: Greer, Ross, et al.
Publicado: (2025)
por: Greer, Ross, et al.
Publicado: (2025)
Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement
por: Tran, Phat, et al.
Publicado: (2026)
por: Tran, Phat, et al.
Publicado: (2026)
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
por: Waseda, Futa, et al.
Publicado: (2025)
por: Waseda, Futa, et al.
Publicado: (2025)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
por: Ray, Sourjyadip, et al.
Publicado: (2024)
por: Ray, Sourjyadip, et al.
Publicado: (2024)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
por: Darabi, Nastaran, et al.
Publicado: (2026)
por: Darabi, Nastaran, et al.
Publicado: (2026)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
por: Hong, Wenyi, et al.
Publicado: (2025)
por: Hong, Wenyi, et al.
Publicado: (2025)
Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition
por: Brettmann, Alexander, et al.
Publicado: (2025)
por: Brettmann, Alexander, et al.
Publicado: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
Character Mixing for Video Generation
por: Liao, Tingting, et al.
Publicado: (2025)
por: Liao, Tingting, et al.
Publicado: (2025)
Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition
por: Bhatia, Gagan, et al.
Publicado: (2024)
por: Bhatia, Gagan, et al.
Publicado: (2024)
The Urban Vision Hackathon Dataset and Models: Towards Image Annotations and Accurate Vision Models for Indian Traffic
por: Sharma, Akash, et al.
Publicado: (2025)
por: Sharma, Akash, et al.
Publicado: (2025)
Benchmarking Large Language Models for Handwritten Text Recognition
por: Crosilla, Giorgia, et al.
Publicado: (2025)
por: Crosilla, Giorgia, et al.
Publicado: (2025)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
por: Xu, Zhenlin, et al.
Publicado: (2023)
por: Xu, Zhenlin, et al.
Publicado: (2023)
Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
por: Wang, Jin, et al.
Publicado: (2026)
por: Wang, Jin, et al.
Publicado: (2026)
Shape and Texture Recognition in Large Vision-Language Models
por: Eppel, Sagi, et al.
Publicado: (2025)
por: Eppel, Sagi, et al.
Publicado: (2025)
Open-Set Recognition in the Age of Vision-Language Models
por: Miller, Dimity, et al.
Publicado: (2024)
por: Miller, Dimity, et al.
Publicado: (2024)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
por: Gopalkrishnan, Akshay, et al.
Publicado: (2024)
por: Gopalkrishnan, Akshay, et al.
Publicado: (2024)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
por: Du, Hao, et al.
Publicado: (2025)
por: Du, Hao, et al.
Publicado: (2025)
AnimationBench: Are Video Models Good at Character-Centric Animation?
por: Wu, Leyi, et al.
Publicado: (2026)
por: Wu, Leyi, et al.
Publicado: (2026)
MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling
por: Men, Yifang, et al.
Publicado: (2024)
por: Men, Yifang, et al.
Publicado: (2024)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
por: Sathe, Ashutosh, et al.
Publicado: (2024)
por: Sathe, Ashutosh, et al.
Publicado: (2024)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
por: Qiu, Di, et al.
Publicado: (2024)
por: Qiu, Di, et al.
Publicado: (2024)
Distilling Vision-Language Models on Millions of Videos
por: Zhao, Yue, et al.
Publicado: (2024)
por: Zhao, Yue, et al.
Publicado: (2024)
VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos
por: Li, Kaining, et al.
Publicado: (2025)
por: Li, Kaining, et al.
Publicado: (2025)
Ejemplares similares
-
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
por: Sharma, Shivam, et al.
Publicado: (2026) -
BadScan: An Architectural Backdoor Attack on Visual State Space Models
por: Deshmukh, Om Suhas, et al.
Publicado: (2024) -
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024) -
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
por: Haq, Ijazul, et al.
Publicado: (2025) -
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
por: Waly, Alhossien, et al.
Publicado: (2025)