Enregistré dans:
| Auteurs principaux: | Momayiz, Imane, Elaouad, Soufiane Ait, Elmajjodi, Abdeljalil, Bouanane, Haitame |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.08070 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025)
par: Most, Alexander, et autres
Publié: (2025)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
Computer Vision Intelligence Test Modeling and Generation: A Case Study on Smart OCR
par: Shu, Jing, et autres
Publié: (2024)
par: Shu, Jing, et autres
Publié: (2024)
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026)
par: Karamolegkou, Antonia, et autres
Publié: (2026)
GutenOCR: A Grounded Vision-Language Front-End for Documents
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
par: Haq, Ijazul, et autres
Publié: (2025)
par: Haq, Ijazul, et autres
Publié: (2025)
QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
par: Wasfy, Ahmed, et autres
Publié: (2025)
par: Wasfy, Ahmed, et autres
Publié: (2025)
Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis
par: Szankin, Maciej, et autres
Publié: (2025)
par: Szankin, Maciej, et autres
Publié: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
par: Duan, Chen, et autres
Publié: (2024)
par: Duan, Chen, et autres
Publié: (2024)
Automated Invoice Data Extraction: Using LLM and OCR
par: Khanchandani, Khushi, et autres
Publié: (2025)
par: Khanchandani, Khushi, et autres
Publié: (2025)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
par: Rashad, Mohamed
Publié: (2024)
par: Rashad, Mohamed
Publié: (2024)
Evaluating OCR performance on food packaging labels in South Africa
par: Nagayi, Mayimunah, et autres
Publié: (2025)
par: Nagayi, Mayimunah, et autres
Publié: (2025)
Confidence-Aware Document OCR Error Detection
par: Hemmer, Arthur, et autres
Publié: (2024)
par: Hemmer, Arthur, et autres
Publié: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
Enhancement of Bengali OCR by Specialized Models and Advanced Techniques for Diverse Document Types
par: Rabby, AKM Shahariar Azad, et autres
Publié: (2024)
par: Rabby, AKM Shahariar Azad, et autres
Publié: (2024)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
par: Faraz, Ali, et autres
Publié: (2026)
par: Faraz, Ali, et autres
Publié: (2026)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024)
par: Shen, Zhixuan, et autres
Publié: (2024)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
par: Tang, Haocheng, et autres
Publié: (2026)
par: Tang, Haocheng, et autres
Publié: (2026)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
par: Vesalainen, Ari, et autres
Publié: (2026)
par: Vesalainen, Ari, et autres
Publié: (2026)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
par: Tien, Dong Nguyen, et autres
Publié: (2025)
par: Tien, Dong Nguyen, et autres
Publié: (2025)
Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models
par: Mulukutla, Vamsi Krishna, et autres
Publié: (2025)
par: Mulukutla, Vamsi Krishna, et autres
Publié: (2025)
CAD-Coder: An Open-Source Vision-Language Model for Computer-Aided Design Code Generation
par: Doris, Anna C., et autres
Publié: (2025)
par: Doris, Anna C., et autres
Publié: (2025)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
par: Taghadouini, Said, et autres
Publié: (2026)
par: Taghadouini, Said, et autres
Publié: (2026)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
par: Zhang, Yulong, et autres
Publié: (2025)
par: Zhang, Yulong, et autres
Publié: (2025)
Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR
par: Dhakal, Sisir, et autres
Publié: (2024)
par: Dhakal, Sisir, et autres
Publié: (2024)
Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR
par: Yuan, Ziye, et autres
Publié: (2026)
par: Yuan, Ziye, et autres
Publié: (2026)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
par: Hung, Chia-Yu, et autres
Publié: (2025)
par: Hung, Chia-Yu, et autres
Publié: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
par: Gillani, Syeda Anshrah, et autres
Publié: (2025)
par: Gillani, Syeda Anshrah, et autres
Publié: (2025)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
par: Zhong, Yufeng, et autres
Publié: (2026)
par: Zhong, Yufeng, et autres
Publié: (2026)
JaPOC: Japanese Post-OCR Correction Benchmark using Vouchers
par: Fujitake, Masato
Publié: (2024)
par: Fujitake, Masato
Publié: (2024)
Early evidence of how LLMs outperform traditional systems on OCR/HTR tasks for historical records
par: Kim, Seorin, et autres
Publié: (2025)
par: Kim, Seorin, et autres
Publié: (2025)
Documents similaires
-
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026) -
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025) -
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025) -
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025) -
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
par: Nigam, Shubham Kumar, et autres
Publié: (2025)