OCR-Agent: Agentic OCR with Capability and Memory Reflection
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Shimin, Zhang, Zeyu, Bian, Xingdou, Zhu, Hongjie, He, Lulu, Shama, Layi, Ergu, Daji, Cai, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026)
di: Liu, Bonan, et al.
Pubblicazione: (2026)
DOEI: Dual Optimization of Embedding Information for Attention-Enhanced Class Activation Maps
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
Dynamic Domain Adaptation-Driven Physics-Informed Graph Representation Learning for AC-OPF
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
SSS: Semi-Supervised SAM-2 with Efficient Prompting for Medical Imaging Segmentation
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
di: Zhu, Hongjie, et al.
Pubblicazione: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
SegStitch: Multidimensional Transformer for Robust and Efficient Medical Imaging Segmentation
di: Tan, Shengbo, et al.
Pubblicazione: (2024)
di: Tan, Shengbo, et al.
Pubblicazione: (2024)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
di: Chen, Qian, et al.
Pubblicazione: (2025)
di: Chen, Qian, et al.
Pubblicazione: (2025)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
Medical Artificial Intelligence for Early Detection of Lung Cancer: A Survey
di: Cai, Guohui, et al.
Pubblicazione: (2024)
di: Cai, Guohui, et al.
Pubblicazione: (2024)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
Agentar-Fin-OCR
di: Qian, Siyi, et al.
Pubblicazione: (2026)
di: Qian, Siyi, et al.
Pubblicazione: (2026)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
di: Sun, Lin, et al.
Pubblicazione: (2026)
di: Sun, Lin, et al.
Pubblicazione: (2026)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
di: Chen, Song, et al.
Pubblicazione: (2025)
di: Chen, Song, et al.
Pubblicazione: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
di: Zhang, Yulong
Pubblicazione: (2025)
di: Zhang, Yulong
Pubblicazione: (2025)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
MSDet: Receptive Field Enhanced Multiscale Detection for Tiny Pulmonary Nodule
di: Cai, Guohui, et al.
Pubblicazione: (2024)
di: Cai, Guohui, et al.
Pubblicazione: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
ABot-OCR Technical Report
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
di: Jiang, Kaitao, et al.
Pubblicazione: (2026)
Multimodal OCR: Parse Anything from Documents
di: Zheng, Handong, et al.
Pubblicazione: (2026)
di: Zheng, Handong, et al.
Pubblicazione: (2026)
SegKAN: High-Resolution Medical Image Segmentation with Long-Distance Dependencies
di: Tan, Shengbo, et al.
Pubblicazione: (2024)
di: Tan, Shengbo, et al.
Pubblicazione: (2024)
HunyuanOCR Technical Report
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
di: Hunyuan Vision Team, et al.
Pubblicazione: (2025)
PaddleOCR 3.0 Technical Report
di: Cui, Cheng, et al.
Pubblicazione: (2025)
di: Cui, Cheng, et al.
Pubblicazione: (2025)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
di: Vesalainen, Ari, et al.
Pubblicazione: (2026)
MedDet: Generative Adversarial Distillation for Efficient Cervical Disc Herniation Detection
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
DODO: Discrete OCR Diffusion Models
di: Man, Sean, et al.
Pubblicazione: (2026)
di: Man, Sean, et al.
Pubblicazione: (2026)
An Empirical Study of Scaling Law for OCR
di: Rang, Miao, et al.
Pubblicazione: (2023)
di: Rang, Miao, et al.
Pubblicazione: (2023)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
di: Taghadouini, Said, et al.
Pubblicazione: (2026)
di: Taghadouini, Said, et al.
Pubblicazione: (2026)
DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning
di: Xu, Dongsheng, et al.
Pubblicazione: (2023)
di: Xu, Dongsheng, et al.
Pubblicazione: (2023)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
di: He, Zhentao, et al.
Pubblicazione: (2025)
di: He, Zhentao, et al.
Pubblicazione: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
di: Guan, Shuhao, et al.
Pubblicazione: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
di: Momayiz, Imane, et al.
Pubblicazione: (2026)
DeepSeek-OCR: Contexts Optical Compression
di: Wei, Haoran, et al.
Pubblicazione: (2025)
di: Wei, Haoran, et al.
Pubblicazione: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
UPOCR: Towards Unified Pixel-Level OCR Interface
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance
di: Ye, Keren, et al.
Pubblicazione: (2025)
di: Ye, Keren, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OmniOCR: Generalist OCR for Ethnic Minority Languages
di: Liu, Bonan, et al.
Pubblicazione: (2026) -
DOEI: Dual Optimization of Embedding Information for Attention-Enhanced Class Activation Maps
di: Zhu, Hongjie, et al.
Pubblicazione: (2025) -
Dynamic Domain Adaptation-Driven Physics-Informed Graph Representation Learning for AC-OPF
di: Zhu, Hongjie, et al.
Pubblicazione: (2025) -
SSS: Semi-Supervised SAM-2 with Efficient Prompting for Medical Imaging Segmentation
di: Zhu, Hongjie, et al.
Pubblicazione: (2025) -
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)