Evaluating OCR performance on food packaging labels in South Africa
Fuente:
arXiv
Saved in:
| Main Authors: | Nagayi, Mayimunah, Khan, Alice, Frank, Tamryn, Swart, Rina, Nyirenda, Clement |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Affinity Propagation for Improved Public Sentiment Insights
by: Nagayi, Mayimunah, et al.
Published: (2024)
by: Nagayi, Mayimunah, et al.
Published: (2024)
Auditing Facial Emotion Recognition Datasets for Posed Expressions and Racial Bias
by: Khan, Rina, et al.
Published: (2025)
by: Khan, Rina, et al.
Published: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
by: Zhang, Yulong
Published: (2025)
by: Zhang, Yulong
Published: (2025)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
HunyuanOCR Technical Report
by: Hunyuan Vision Team, et al.
Published: (2025)
by: Hunyuan Vision Team, et al.
Published: (2025)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
by: Momayiz, Imane, et al.
Published: (2026)
by: Momayiz, Imane, et al.
Published: (2026)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
by: Tien, Dong Nguyen, et al.
Published: (2025)
by: Tien, Dong Nguyen, et al.
Published: (2025)
Automated Invoice Data Extraction: Using LLM and OCR
by: Khanchandani, Khushi, et al.
Published: (2025)
by: Khanchandani, Khushi, et al.
Published: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
by: Duan, Chen, et al.
Published: (2024)
by: Duan, Chen, et al.
Published: (2024)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
by: Cardoso, Gabriel Pimenta de Freitas, et al.
Published: (2026)
by: Cardoso, Gabriel Pimenta de Freitas, et al.
Published: (2026)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
by: Most, Alexander, et al.
Published: (2025)
by: Most, Alexander, et al.
Published: (2025)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
by: Faraz, Ali, et al.
Published: (2026)
by: Faraz, Ali, et al.
Published: (2026)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
by: Liu, Yuliang, et al.
Published: (2024)
by: Liu, Yuliang, et al.
Published: (2024)
Confidence-Aware Document OCR Error Detection
by: Hemmer, Arthur, et al.
Published: (2024)
by: Hemmer, Arthur, et al.
Published: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
by: Shen, Zhixuan, et al.
Published: (2024)
by: Shen, Zhixuan, et al.
Published: (2024)
Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis
by: Szankin, Maciej, et al.
Published: (2025)
by: Szankin, Maciej, et al.
Published: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
by: Gillani, Syeda Anshrah, et al.
Published: (2025)
by: Gillani, Syeda Anshrah, et al.
Published: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
by: Zhong, Yufeng, et al.
Published: (2025)
by: Zhong, Yufeng, et al.
Published: (2025)
Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments
by: Ali, Muhammad, et al.
Published: (2025)
by: Ali, Muhammad, et al.
Published: (2025)
QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
by: Wasfy, Ahmed, et al.
Published: (2025)
by: Wasfy, Ahmed, et al.
Published: (2025)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
by: Zhang, Jiarui, et al.
Published: (2025)
by: Zhang, Jiarui, et al.
Published: (2025)
Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR
by: Dhakal, Sisir, et al.
Published: (2024)
by: Dhakal, Sisir, et al.
Published: (2024)
Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR
by: Yuan, Ziye, et al.
Published: (2026)
by: Yuan, Ziye, et al.
Published: (2026)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
by: Tang, Haocheng, et al.
Published: (2026)
by: Tang, Haocheng, et al.
Published: (2026)
Seg-metrics: a Python package to compute segmentation metrics
by: Jia, Jingnan, et al.
Published: (2024)
by: Jia, Jingnan, et al.
Published: (2024)
Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities
by: Levchenko, Maria
Published: (2025)
by: Levchenko, Maria
Published: (2025)
Classifier-guided CLIP Distillation for Unsupervised Multi-label Classification
by: Kim, Dongseob, et al.
Published: (2025)
by: Kim, Dongseob, et al.
Published: (2025)
Embedded Multi-label Feature Selection via Orthogonal Regression
by: Xu, Xueyuan, et al.
Published: (2024)
by: Xu, Xueyuan, et al.
Published: (2024)
MOD-CL: Multi-label Object Detection with Constrained Loss
by: Moriyama, Sota, et al.
Published: (2024)
by: Moriyama, Sota, et al.
Published: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
by: Malik, Hashmat Shadab, et al.
Published: (2024)
by: Malik, Hashmat Shadab, et al.
Published: (2024)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
by: Rashad, Mohamed
Published: (2024)
by: Rashad, Mohamed
Published: (2024)
Enhancing Close-up Novel View Synthesis via Pseudo-labeling
by: Xia, Jiatong, et al.
Published: (2025)
by: Xia, Jiatong, et al.
Published: (2025)
Pseudo-label Based Domain Adaptation for Zero-Shot Text Steganalysis
by: Luo, Yufei, et al.
Published: (2024)
by: Luo, Yufei, et al.
Published: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
by: Yu, Ya-Qi, et al.
Published: (2024)
by: Yu, Ya-Qi, et al.
Published: (2024)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
by: Zhang, Yulong, et al.
Published: (2025)
by: Zhang, Yulong, et al.
Published: (2025)
Cross-Dataset Generalization For Retinal Lesions Segmentation
by: Playout, Clément, et al.
Published: (2024)
by: Playout, Clément, et al.
Published: (2024)
Automated Wicket-Taking Delivery Segmentation and Trajectory-Based Dismissal-Zone Analysis in Cricket Videos Using OCR-Guided YOLOv8
by: Karmoker, Joy, et al.
Published: (2025)
by: Karmoker, Joy, et al.
Published: (2025)
Learning to detect cloud and snow in remote sensing images from noisy labels
by: Liu, Zili, et al.
Published: (2024)
by: Liu, Zili, et al.
Published: (2024)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
by: Baby, Britty, et al.
Published: (2025)
by: Baby, Britty, et al.
Published: (2025)
MedSAM-based lung masking for multi-label chest X-ray classification
by: Miao, Brayden, et al.
Published: (2025)
by: Miao, Brayden, et al.
Published: (2025)
Similar Items
-
Enhancing Affinity Propagation for Improved Public Sentiment Insights
by: Nagayi, Mayimunah, et al.
Published: (2024) -
Auditing Facial Emotion Recognition Datasets for Posed Expressions and Racial Bias
by: Khan, Rina, et al.
Published: (2025) -
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
by: Zhang, Yulong
Published: (2025) -
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025) -
HunyuanOCR Technical Report
by: Hunyuan Vision Team, et al.
Published: (2025)