OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Junyuan, Zhang, Qintong, Wang, Bin, Ouyang, Linke, Wen, Zichen, Li, Ying, Chow, Ka-Ho, He, Conghui, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)
par: Zhang, Qintong, et autres
Publié: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
par: Wang, Zhengren, et autres
Publié: (2026)
par: Wang, Zhengren, et autres
Publié: (2026)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
par: Dong, Hejun, et autres
Publié: (2026)
par: Dong, Hejun, et autres
Publié: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
par: Zhang, Qintong, et autres
Publié: (2024)
par: Zhang, Qintong, et autres
Publié: (2024)
TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition
par: Zhang, Junyuan, et autres
Publié: (2025)
par: Zhang, Junyuan, et autres
Publié: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
Agentar-Fin-OCR
par: Qian, Siyi, et autres
Publié: (2026)
par: Qian, Siyi, et autres
Publié: (2026)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
PaddleOCR 3.0 Technical Report
par: Cui, Cheng, et autres
Publié: (2025)
par: Cui, Cheng, et autres
Publié: (2025)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
Confundo: Learning to Generate Robust Poison for Practical RAG Systems
par: Hu, Haoyang, et autres
Publié: (2026)
par: Hu, Haoyang, et autres
Publié: (2026)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
par: Gagnier, Henry, et autres
Publié: (2026)
par: Gagnier, Henry, et autres
Publié: (2026)
Multimodal OCR: Parse Anything from Documents
par: Zheng, Handong, et autres
Publié: (2026)
par: Zheng, Handong, et autres
Publié: (2026)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
PubMed-OCR: PMC Open Access OCR Annotations
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
ABot-OCR Technical Report
par: Jiang, Kaitao, et autres
Publié: (2026)
par: Jiang, Kaitao, et autres
Publié: (2026)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
par: Zhao, Zhiyuan, et autres
Publié: (2023)
par: Zhao, Zhiyuan, et autres
Publié: (2023)
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
Evaluation of Ensemble Learning Techniques for handwritten OCR Improvement
par: Preiß, Martin
Publié: (2025)
par: Preiß, Martin
Publié: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
par: Li, Zhang, et autres
Publié: (2025)
par: Li, Zhang, et autres
Publié: (2025)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
par: Cao, Linhan, et autres
Publié: (2026)
par: Cao, Linhan, et autres
Publié: (2026)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
par: Most, Alexander, et autres
Publié: (2025)
par: Most, Alexander, et autres
Publié: (2025)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
par: Vesalainen, Ari, et autres
Publié: (2026)
par: Vesalainen, Ari, et autres
Publié: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
par: Guan, Shuhao, et autres
Publié: (2025)
par: Guan, Shuhao, et autres
Publié: (2025)
Documents similaires
-
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025) -
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
par: Wang, Zhengren, et autres
Publié: (2026) -
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026) -
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
par: Dong, Hejun, et autres
Publié: (2026) -
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)