When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Lin, Dexian, Wang, Huang, Jingang, Zhang, Linglin, Jia, Change, Cheng, Zhengwei, Zhang, Xiangzheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026)
di: Liu, Bonan, et al.
Pubblicazione: (2026)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
di: Chen, Song, et al.
Pubblicazione: (2025)
di: Chen, Song, et al.
Pubblicazione: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
BEAR: Budgeted Evidence Allocation for Multi-Document Reasoning
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
PaddleOCR 3.0 Technical Report
di: Cui, Cheng, et al.
Pubblicazione: (2025)
di: Cui, Cheng, et al.
Pubblicazione: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
di: Wen, Shimin, et al.
Pubblicazione: (2026)
di: Wen, Shimin, et al.
Pubblicazione: (2026)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
Agentar-Fin-OCR
di: Qian, Siyi, et al.
Pubblicazione: (2026)
di: Qian, Siyi, et al.
Pubblicazione: (2026)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
di: Zhang, Yulong
Pubblicazione: (2025)
di: Zhang, Yulong
Pubblicazione: (2025)
FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
di: He, Yueru, et al.
Pubblicazione: (2025)
di: He, Yueru, et al.
Pubblicazione: (2025)
ABot-OCR Technical Report
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
di: Most, Alexander, et al.
Pubblicazione: (2025)
di: Most, Alexander, et al.
Pubblicazione: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
OMG-Seg: Is One Model Good Enough For All Segmentation?
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
di: Chen, Qian, et al.
Pubblicazione: (2025)
di: Chen, Qian, et al.
Pubblicazione: (2025)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning
di: Xu, Dongsheng, et al.
Pubblicazione: (2023)
di: Xu, Dongsheng, et al.
Pubblicazione: (2023)
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
DeepSeek-OCR: Contexts Optical Compression
di: Wei, Haoran, et al.
Pubblicazione: (2025)
di: Wei, Haoran, et al.
Pubblicazione: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
HunyuanOCR Technical Report
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
Multimodal OCR: Parse Anything from Documents
di: Zheng, Handong, et al.
Pubblicazione: (2026)
di: Zheng, Handong, et al.
Pubblicazione: (2026)
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
An Empirical Study of Scaling Law for OCR
di: Rang, Miao, et al.
Pubblicazione: (2023)
di: Rang, Miao, et al.
Pubblicazione: (2023)
DeepSeek-OCR 2: Visual Causal Flow
di: Wei, Haoran, et al.
Pubblicazione: (2026)
di: Wei, Haoran, et al.
Pubblicazione: (2026)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
di: Molina, Adrià, et al.
Pubblicazione: (2024)
di: Molina, Adrià, et al.
Pubblicazione: (2024)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters
di: Li, Gengluo, et al.
Pubblicazione: (2026)
di: Li, Gengluo, et al.
Pubblicazione: (2026)
DODO: Discrete OCR Diffusion Models
di: Man, Sean, et al.
Pubblicazione: (2026)
di: Man, Sean, et al.
Pubblicazione: (2026)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
di: Taghadouini, Said, et al.
Pubblicazione: (2026)
di: Taghadouini, Said, et al.
Pubblicazione: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
di: He, Zhentao, et al.
Pubblicazione: (2025)
di: He, Zhentao, et al.
Pubblicazione: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
di: Zhang, Junyuan, et al.
Pubblicazione: (2024) -
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026) -
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
di: Chen, Song, et al.
Pubblicazione: (2025) -
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024) -
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
di: Wang, Zhengren, et al.
Pubblicazione: (2026)