General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wei, Haoran, Liu, Chenglong, Chen, Jinyue, Wang, Jia, Kong, Lingyu, Xu, Yanming, Ge, Zheng, Zhao, Liang, Sun, Jianjian, Peng, Yuang, Han, Chunrui, Zhang, Xiangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
par: Chen, Jinyue, et autres
Publié: (2024)
par: Chen, Jinyue, et autres
Publié: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
par: Liu, Chenglong, et autres
Publié: (2024)
par: Liu, Chenglong, et autres
Publié: (2024)
Small Language Model Meets with Reinforced Vision Vocabulary
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
par: Dong, Daxiang, et autres
Publié: (2026)
par: Dong, Daxiang, et autres
Publié: (2026)
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
par: Han, Chunrui, et autres
Publié: (2023)
par: Han, Chunrui, et autres
Publié: (2023)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
par: Zhong, Yufeng, et autres
Publié: (2026)
par: Zhong, Yufeng, et autres
Publié: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
DreamLLM: Synergistic Multimodal Comprehension and Creation
par: Dong, Runpei, et autres
Publié: (2023)
par: Dong, Runpei, et autres
Publié: (2023)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
par: Shu, Bao, et autres
Publié: (2025)
par: Shu, Bao, et autres
Publié: (2025)
DeepSeek-OCR: Contexts Optical Compression
par: Wei, Haoran, et autres
Publié: (2025)
par: Wei, Haoran, et autres
Publié: (2025)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
par: Taghadouini, Said, et autres
Publié: (2026)
par: Taghadouini, Said, et autres
Publié: (2026)
DeepSeek-OCR 2: Visual Causal Flow
par: Wei, Haoran, et autres
Publié: (2026)
par: Wei, Haoran, et autres
Publié: (2026)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
par: Yu, En, et autres
Publié: (2025)
par: Yu, En, et autres
Publié: (2025)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
Agentar-Fin-OCR
par: Qian, Siyi, et autres
Publié: (2026)
par: Qian, Siyi, et autres
Publié: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
PaddleOCR 3.0 Technical Report
par: Cui, Cheng, et autres
Publié: (2025)
par: Cui, Cheng, et autres
Publié: (2025)
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
PubMed-OCR: PMC Open Access OCR Annotations
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
FireRed-OCR Technical Report
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Towards Deployable OCR models for Indic languages
par: Mathew, Minesh, et autres
Publié: (2022)
par: Mathew, Minesh, et autres
Publié: (2022)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
Perception in Reflection
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
par: Zhu, Zining, et autres
Publié: (2025)
par: Zhu, Zining, et autres
Publié: (2025)
An Empirical Study of Scaling Law for OCR
par: Rang, Miao, et autres
Publié: (2023)
par: Rang, Miao, et autres
Publié: (2023)
GutenOCR: A Grounded Vision-Language Front-End for Documents
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
par: Peng, Yibo, et autres
Publié: (2026)
par: Peng, Yibo, et autres
Publié: (2026)
Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents
par: Greif, Gavin, et autres
Publié: (2025)
par: Greif, Gavin, et autres
Publié: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
AnonLFI 2.0: Extensible Architecture for PII Pseudonymization in CSIRTs with OCR and Technical Recognizers
par: Kapelinski, Cristhian, et autres
Publié: (2025)
par: Kapelinski, Cristhian, et autres
Publié: (2025)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
ABot-OCR Technical Report
par: Jiang, Kaitao, et autres
Publié: (2026)
par: Jiang, Kaitao, et autres
Publié: (2026)
OCR concerned with institute's accessibility
Publié: (2024)
Publié: (2024)
Documents similaires
-
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
par: Chen, Jinyue, et autres
Publié: (2024) -
Focus Anywhere for Fine-grained Multi-page Document Understanding
par: Liu, Chenglong, et autres
Publié: (2024) -
Small Language Model Meets with Reinforced Vision Vocabulary
par: Wei, Haoran, et autres
Publié: (2024) -
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
par: Dong, Daxiang, et autres
Publié: (2026) -
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
par: Han, Chunrui, et autres
Publié: (2023)