Evaluating OCR performance on food packaging labels in South Africa
Fuente:
arXiv
Salvato in:
| Autori principali: | Nagayi, Mayimunah, Khan, Alice, Frank, Tamryn, Swart, Rina, Nyirenda, Clement |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Affinity Propagation for Improved Public Sentiment Insights
di: Nagayi, Mayimunah, et al.
Pubblicazione: (2024)
di: Nagayi, Mayimunah, et al.
Pubblicazione: (2024)
Auditing Facial Emotion Recognition Datasets for Posed Expressions and Racial Bias
di: Khan, Rina, et al.
Pubblicazione: (2025)
di: Khan, Rina, et al.
Pubblicazione: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
di: Zhang, Yulong
Pubblicazione: (2025)
di: Zhang, Yulong
Pubblicazione: (2025)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
HunyuanOCR Technical Report
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
Automated Invoice Data Extraction: Using LLM and OCR
di: Khanchandani, Khushi, et al.
Pubblicazione: (2025)
di: Khanchandani, Khushi, et al.
Pubblicazione: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
di: Cardoso, Gabriel Pimenta de Freitas, et al.
Pubblicazione: (2026)
di: Cardoso, Gabriel Pimenta de Freitas, et al.
Pubblicazione: (2026)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
di: Most, Alexander, et al.
Pubblicazione: (2025)
di: Most, Alexander, et al.
Pubblicazione: (2025)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
di: Faraz, Ali, et al.
Pubblicazione: (2026)
di: Faraz, Ali, et al.
Pubblicazione: (2026)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
Confidence-Aware Document OCR Error Detection
di: Hemmer, Arthur, et al.
Pubblicazione: (2024)
di: Hemmer, Arthur, et al.
Pubblicazione: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis
di: Szankin, Maciej, et al.
Pubblicazione: (2025)
di: Szankin, Maciej, et al.
Pubblicazione: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
di: Gillani, Syeda Anshrah, et al.
Pubblicazione: (2025)
di: Gillani, Syeda Anshrah, et al.
Pubblicazione: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
di: Zhong, Yufeng, et al.
Pubblicazione: (2025)
di: Zhong, Yufeng, et al.
Pubblicazione: (2025)
Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments
di: Ali, Muhammad, et al.
Pubblicazione: (2025)
di: Ali, Muhammad, et al.
Pubblicazione: (2025)
QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
di: Wasfy, Ahmed, et al.
Pubblicazione: (2025)
di: Wasfy, Ahmed, et al.
Pubblicazione: (2025)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR
di: Dhakal, Sisir, et al.
Pubblicazione: (2024)
di: Dhakal, Sisir, et al.
Pubblicazione: (2024)
Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR
di: Yuan, Ziye, et al.
Pubblicazione: (2026)
di: Yuan, Ziye, et al.
Pubblicazione: (2026)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
di: Tang, Haocheng, et al.
Pubblicazione: (2026)
di: Tang, Haocheng, et al.
Pubblicazione: (2026)
Seg-metrics: a Python package to compute segmentation metrics
di: Jia, Jingnan, et al.
Pubblicazione: (2024)
di: Jia, Jingnan, et al.
Pubblicazione: (2024)
Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities
di: Levchenko, Maria
Pubblicazione: (2025)
di: Levchenko, Maria
Pubblicazione: (2025)
Classifier-guided CLIP Distillation for Unsupervised Multi-label Classification
di: Kim, Dongseob, et al.
Pubblicazione: (2025)
di: Kim, Dongseob, et al.
Pubblicazione: (2025)
Embedded Multi-label Feature Selection via Orthogonal Regression
di: Xu, Xueyuan, et al.
Pubblicazione: (2024)
di: Xu, Xueyuan, et al.
Pubblicazione: (2024)
MOD-CL: Multi-label Object Detection with Constrained Loss
di: Moriyama, Sota, et al.
Pubblicazione: (2024)
di: Moriyama, Sota, et al.
Pubblicazione: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
di: Rashad, Mohamed
Pubblicazione: (2024)
di: Rashad, Mohamed
Pubblicazione: (2024)
Enhancing Close-up Novel View Synthesis via Pseudo-labeling
di: Xia, Jiatong, et al.
Pubblicazione: (2025)
di: Xia, Jiatong, et al.
Pubblicazione: (2025)
Pseudo-label Based Domain Adaptation for Zero-Shot Text Steganalysis
di: Luo, Yufei, et al.
Pubblicazione: (2024)
di: Luo, Yufei, et al.
Pubblicazione: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
Cross-Dataset Generalization For Retinal Lesions Segmentation
di: Playout, Clément, et al.
Pubblicazione: (2024)
di: Playout, Clément, et al.
Pubblicazione: (2024)
Automated Wicket-Taking Delivery Segmentation and Trajectory-Based Dismissal-Zone Analysis in Cricket Videos Using OCR-Guided YOLOv8
di: Karmoker, Joy, et al.
Pubblicazione: (2025)
di: Karmoker, Joy, et al.
Pubblicazione: (2025)
Learning to detect cloud and snow in remote sensing images from noisy labels
di: Liu, Zili, et al.
Pubblicazione: (2024)
di: Liu, Zili, et al.
Pubblicazione: (2024)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
di: Baby, Britty, et al.
Pubblicazione: (2025)
di: Baby, Britty, et al.
Pubblicazione: (2025)
MedSAM-based lung masking for multi-label chest X-ray classification
di: Miao, Brayden, et al.
Pubblicazione: (2025)
di: Miao, Brayden, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Affinity Propagation for Improved Public Sentiment Insights
di: Nagayi, Mayimunah, et al.
Pubblicazione: (2024) -
Auditing Facial Emotion Recognition Datasets for Posed Expressions and Racial Bias
di: Khan, Rina, et al.
Pubblicazione: (2025) -
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
di: Zhang, Yulong
Pubblicazione: (2025) -
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
di: Haq, Ijazul, et al.
Pubblicazione: (2025) -
HunyuanOCR Technical Report
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)