Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Faraz, Ali, Kolla, Raja, Kulkarni, Ashish, Agarwal, Shubham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
di: Khan, Shaharukh, et al.
Pubblicazione: (2026)
di: Khan, Shaharukh, et al.
Pubblicazione: (2026)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
di: Faraz, Ali, et al.
Pubblicazione: (2025)
di: Faraz, Ali, et al.
Pubblicazione: (2025)
Seeing Straight: Document Orientation Detection for Efficient OCR
di: Goswami, Suranjan, et al.
Pubblicazione: (2025)
di: Goswami, Suranjan, et al.
Pubblicazione: (2025)
Chitrarth: Bridging Vision and Language for a Billion People
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
A Novel AI-Driven System for Real-Time Detection of Mirror Absence, Helmet Non-Compliance, and License Plates Using YOLOv8 and OCR
di: Hegde, Nishant Vasantkumar, et al.
Pubblicazione: (2025)
di: Hegde, Nishant Vasantkumar, et al.
Pubblicazione: (2025)
Efficient Learning for Product Attributes with Compact Multimodal Models
di: Kulkarni, Mandar
Pubblicazione: (2025)
di: Kulkarni, Mandar
Pubblicazione: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism
di: Li, Kaiyu, et al.
Pubblicazione: (2025)
di: Li, Kaiyu, et al.
Pubblicazione: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
di: Zhang, Yulong
Pubblicazione: (2025)
di: Zhang, Yulong
Pubblicazione: (2025)
Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation
di: Waseem, Faraz, et al.
Pubblicazione: (2024)
di: Waseem, Faraz, et al.
Pubblicazione: (2024)
Learnable Prompt for Few-Shot Semantic Segmentation in Remote Sensing Domain
di: Immanuel, Steve Andreas, et al.
Pubblicazione: (2024)
di: Immanuel, Steve Andreas, et al.
Pubblicazione: (2024)
Harnessing Shared Relations via Multimodal Mixup Contrastive Learning for Multimodal Classification
di: Kumar, Raja, et al.
Pubblicazione: (2024)
di: Kumar, Raja, et al.
Pubblicazione: (2024)
HunyuanOCR Technical Report
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
Ridgeformer: Mutli-Stage Contrastive Training For Fine-grained Cross-Domain Fingerprint Recognition
di: Pandey, Shubham, et al.
Pubblicazione: (2025)
di: Pandey, Shubham, et al.
Pubblicazione: (2025)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
Can GPT-4o mini and Gemini 2.0 Flash Predict Fine-Grained Fashion Product Attributes? A Zero-Shot Analysis
di: Shukla, Shubham, et al.
Pubblicazione: (2025)
di: Shukla, Shubham, et al.
Pubblicazione: (2025)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2025)
di: Nigam, Shubham Kumar, et al.
Pubblicazione: (2025)
IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
di: Fan, Qizhe, et al.
Pubblicazione: (2025)
di: Fan, Qizhe, et al.
Pubblicazione: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
Automated Invoice Data Extraction: Using LLM and OCR
di: Khanchandani, Khushi, et al.
Pubblicazione: (2025)
di: Khanchandani, Khushi, et al.
Pubblicazione: (2025)
Attack-Aware Deepfake Detection under Counter-Forensic Manipulations
di: Fatima, Noor, et al.
Pubblicazione: (2025)
di: Fatima, Noor, et al.
Pubblicazione: (2025)
SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation
di: Khan, Hasan Faraz, et al.
Pubblicazione: (2025)
di: Khan, Hasan Faraz, et al.
Pubblicazione: (2025)
LICA: Layered Image Composition Annotations for Graphic Design Research
di: Hirsch, Elad, et al.
Pubblicazione: (2026)
di: Hirsch, Elad, et al.
Pubblicazione: (2026)
Evaluating OCR performance on food packaging labels in South Africa
di: Nagayi, Mayimunah, et al.
Pubblicazione: (2025)
di: Nagayi, Mayimunah, et al.
Pubblicazione: (2025)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
di: Cardoso, Gabriel Pimenta de Freitas, et al.
Pubblicazione: (2026)
di: Cardoso, Gabriel Pimenta de Freitas, et al.
Pubblicazione: (2026)
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
di: Lu, Shuai, et al.
Pubblicazione: (2026)
di: Lu, Shuai, et al.
Pubblicazione: (2026)
Domain-Specific Foundation Model Improves AI-Based Analysis of Neuropathology
di: Verma, Ruchika, et al.
Pubblicazione: (2025)
di: Verma, Ruchika, et al.
Pubblicazione: (2025)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
di: Most, Alexander, et al.
Pubblicazione: (2025)
di: Most, Alexander, et al.
Pubblicazione: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
ZK-WAGON: Imperceptible Watermark for Image Generation Models using ZK-SNARKs
di: Ramakrishnan, Aadarsh Anantha, et al.
Pubblicazione: (2025)
di: Ramakrishnan, Aadarsh Anantha, et al.
Pubblicazione: (2025)
Diffusion Cocktail: Mixing Domain-Specific Diffusion Models for Diversified Image Generations
di: Liu, Haoming, et al.
Pubblicazione: (2023)
di: Liu, Haoming, et al.
Pubblicazione: (2023)
MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation
di: Li, Bo, et al.
Pubblicazione: (2024)
di: Li, Bo, et al.
Pubblicazione: (2024)
Confidence-Aware Document OCR Error Detection
di: Hemmer, Arthur, et al.
Pubblicazione: (2024)
di: Hemmer, Arthur, et al.
Pubblicazione: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
SGD-Mix: Enhancing Domain-Specific Image Classification with Label-Preserving Data Augmentation
di: Dong, Yixuan, et al.
Pubblicazione: (2025)
di: Dong, Yixuan, et al.
Pubblicazione: (2025)
Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis
di: Szankin, Maciej, et al.
Pubblicazione: (2025)
di: Szankin, Maciej, et al.
Pubblicazione: (2025)
Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution
di: Cajas, Sebastian, et al.
Pubblicazione: (2026)
di: Cajas, Sebastian, et al.
Pubblicazione: (2026)
Explainable Face Recognition via Improved Localization
di: Shadman, Rashik, et al.
Pubblicazione: (2025)
di: Shadman, Rashik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
di: Khan, Shaharukh, et al.
Pubblicazione: (2026) -
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
di: Faraz, Ali, et al.
Pubblicazione: (2025) -
Seeing Straight: Document Orientation Detection for Efficient OCR
di: Goswami, Suranjan, et al.
Pubblicazione: (2025) -
Chitrarth: Bridging Vision and Language for a Billion People
di: Khan, Shaharukh, et al.
Pubblicazione: (2025) -
A Novel AI-Driven System for Real-Time Detection of Mirror Absence, Helmet Non-Compliance, and License Plates Using YOLOv8 and OCR
di: Hegde, Nishant Vasantkumar, et al.
Pubblicazione: (2025)