Benchmarking OCR Pipelines with Adaptive Enhancement for Multi-Domain Retail Bill Digitization
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Gaikwad, Vijaysinh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
Federated Adaptive Prompt Tuning for Multi-Domain Collaborative Learning
par: Su, Shangchao, et autres
Publié: (2022)
par: Su, Shangchao, et autres
Publié: (2022)
Enhancement of Bengali OCR by Specialized Models and Advanced Techniques for Diverse Document Types
par: Rabby, AKM Shahariar Azad, et autres
Publié: (2024)
par: Rabby, AKM Shahariar Azad, et autres
Publié: (2024)
A Benchmark of State-Space Models vs. Transformers and BiLSTM-based Models for Historical Newspaper OCR
par: Agbeti-messan, Merveilles, et autres
Publié: (2026)
par: Agbeti-messan, Merveilles, et autres
Publié: (2026)
Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
par: Periasami, Ajay Vikram, et autres
Publié: (2026)
par: Periasami, Ajay Vikram, et autres
Publié: (2026)
Evaluation of Ensemble Learning Techniques for handwritten OCR Improvement
par: Preiß, Martin
Publié: (2025)
par: Preiß, Martin
Publié: (2025)
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
par: Li, Linfei, et autres
Publié: (2025)
par: Li, Linfei, et autres
Publié: (2025)
Deciphering the Underserved: Benchmarking LLM OCR for Low-Resource Scripts
par: Sohail, Muhammad Abdullah, et autres
Publié: (2024)
par: Sohail, Muhammad Abdullah, et autres
Publié: (2024)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
par: Peng, Yibo, et autres
Publié: (2026)
par: Peng, Yibo, et autres
Publié: (2026)
Harmonizing the Deep: A Unified Information Pipeline for Robust Marine Biodiversity Assessment Across Heterogeneous Domains
par: Piccolo, Marco, et autres
Publié: (2026)
par: Piccolo, Marco, et autres
Publié: (2026)
JaPOC: Japanese Post-OCR Correction Benchmark using Vouchers
par: Fujitake, Masato
Publié: (2024)
par: Fujitake, Masato
Publié: (2024)
The Character Error Vector: Decomposable errors for page-level OCR evaluation
par: Bourne, Jonathan, et autres
Publié: (2026)
par: Bourne, Jonathan, et autres
Publié: (2026)
An Automated Pipeline for Few-Shot Bird Call Classification: A Case Study with the Tooth-Billed Pigeon
par: Jana, Abhishek, et autres
Publié: (2025)
par: Jana, Abhishek, et autres
Publié: (2025)
The OCR Quest for Generalization: Learning to recognize low-resource alphabets with model editing
par: Rodríguez, Adrià Molina, et autres
Publié: (2025)
par: Rodríguez, Adrià Molina, et autres
Publié: (2025)
Synthesizing Late-Stage Contrast Enhancement in Breast MRI: A Comprehensive Pipeline Leveraging Temporal Contrast Enhancement Dynamics
par: Fonnegra, Ruben D., et autres
Publié: (2024)
par: Fonnegra, Ruben D., et autres
Publié: (2024)
PubMed-OCR: PMC Open Access OCR Annotations
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
Pseudo Multi-Source Domain Generalization: Bridging the Gap Between Single and Multi-Source Domain Generalization
par: Enomoto, Shohei
Publié: (2025)
par: Enomoto, Shohei
Publié: (2025)
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
par: Robicheaux, Peter, et autres
Publié: (2025)
par: Robicheaux, Peter, et autres
Publié: (2025)
MEDDAP: Medical Dataset Enhancement via Diversified Augmentation Pipeline
par: Medghalchi, Yasamin, et autres
Publié: (2024)
par: Medghalchi, Yasamin, et autres
Publié: (2024)
DAPoinTr: Domain Adaptive Point Transformer for Point Cloud Completion
par: Li, Yinghui, et autres
Publié: (2024)
par: Li, Yinghui, et autres
Publié: (2024)
Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail
par: Lamm, Bianca, et autres
Publié: (2024)
par: Lamm, Bianca, et autres
Publié: (2024)
IndoorCrowd: A Multi-Scene Dataset for Human Detection, Segmentation, and Tracking with an Automated Annotation Pipeline
par: Nae, Sebastian-Ion, et autres
Publié: (2026)
par: Nae, Sebastian-Ion, et autres
Publié: (2026)
Towards Accessible Learning: Deep Learning-Based Potential Dysgraphia Detection and OCR for Potentially Dysgraphic Handwriting
par: D, Vydeki, et autres
Publié: (2024)
par: D, Vydeki, et autres
Publié: (2024)
OCR is All you need: Importing Multi-Modality into Image-based Defect Detection System
par: Hsu, Chih-Chung, et autres
Publié: (2024)
par: Hsu, Chih-Chung, et autres
Publié: (2024)
Page Classification for Print Imaging Pipeline
par: Xu, Shaoyuan, et autres
Publié: (2025)
par: Xu, Shaoyuan, et autres
Publié: (2025)
Cross-Organ Domain Adaptive Neural Network for Pancreatic Endoscopic Ultrasound Image Segmentation
par: Yan, ZhiChao, et autres
Publié: (2024)
par: Yan, ZhiChao, et autres
Publié: (2024)
S-E Pipeline: A Vision Transformer (ViT) based Resilient Classification Pipeline for Medical Imaging Against Adversarial Attacks
par: S, Neha A, et autres
Publié: (2024)
par: S, Neha A, et autres
Publié: (2024)
Improving OCR Quality in 19th Century Historical Documents Using a Combined Machine Learning Based Approach
par: Fleischhacker, David, et autres
Publié: (2024)
par: Fleischhacker, David, et autres
Publié: (2024)
Parameter-efficient Multi-Task and Multi-Domain Learning using Factorized Tensor Networks
par: Garg, Yash, et autres
Publié: (2023)
par: Garg, Yash, et autres
Publié: (2023)
Multi-Domain Brain Vessel Segmentation Through Feature Disentanglement
par: Galati, Francesco, et autres
Publié: (2025)
par: Galati, Francesco, et autres
Publié: (2025)
Boomda: Balanced Multi-objective Optimization for Multimodal Domain Adaptation
par: Sun, Jun, et autres
Publié: (2025)
par: Sun, Jun, et autres
Publié: (2025)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
par: Wang, Xiaohan, et autres
Publié: (2025)
par: Wang, Xiaohan, et autres
Publié: (2025)
TUM2TWIN: Introducing the Large-Scale Multimodal Urban Digital Twin Benchmark Dataset
par: Wysocki, Olaf, et autres
Publié: (2025)
par: Wysocki, Olaf, et autres
Publié: (2025)
Bringing RGB and IR Together: Hierarchical Multi-Modal Enhancement for Robust Transmission Line Detection
par: Zhang, Shengdong, et autres
Publié: (2025)
par: Zhang, Shengdong, et autres
Publié: (2025)
Adaptive Dual-Teacher Distillation with Subnetwork Rectification for Bridging Semantic Gaps in Black-Box Domain Adaptation
par: Zhang, Zhe, et autres
Publié: (2026)
par: Zhang, Zhe, et autres
Publié: (2026)
Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy
par: Roth, Marcel, et autres
Publié: (2024)
par: Roth, Marcel, et autres
Publié: (2024)
Semantic-Rearrangement-Based Multi-Level Alignment for Domain Generalized Segmentation
par: Jiao, Guanlong, et autres
Publié: (2024)
par: Jiao, Guanlong, et autres
Publié: (2024)
Merge-Friendly Post-Training Quantization for Multi-Target Domain Adaptation
par: Shin, Juncheol, et autres
Publié: (2025)
par: Shin, Juncheol, et autres
Publié: (2025)
Pancakes: Consistent Multi-Protocol Image Segmentation Across Biomedical Domains
par: Rakic, Marianne, et autres
Publié: (2025)
par: Rakic, Marianne, et autres
Publié: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
par: Cheng, Daixuan, et autres
Publié: (2024)
par: Cheng, Daixuan, et autres
Publié: (2024)
Documents similaires
-
KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding
par: Heakl, Ahmed, et autres
Publié: (2025) -
Federated Adaptive Prompt Tuning for Multi-Domain Collaborative Learning
par: Su, Shangchao, et autres
Publié: (2022) -
Enhancement of Bengali OCR by Specialized Models and Advanced Techniques for Diverse Document Types
par: Rabby, AKM Shahariar Azad, et autres
Publié: (2024) -
A Benchmark of State-Space Models vs. Transformers and BiLSTM-based Models for Historical Newspaper OCR
par: Agbeti-messan, Merveilles, et autres
Publié: (2026) -
Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
par: Periasami, Ajay Vikram, et autres
Publié: (2026)