Ocean-OCR: Towards General OCR Application via a Vision-Language Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Song, Guo, Xinyu, Li, Yadong, Zhang, Tao, Lin, Mingan, Kuang, Dongdong, Zhang, Youwei, Ming, Lingfeng, Zhang, Fengyu, Wang, Yuran, Xu, Jianhua, Zhou, Zenan, Chen, Weipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
von: Chen, Qian, et al.
Veröffentlicht: (2025)
von: Chen, Qian, et al.
Veröffentlicht: (2025)
OmniOCR: Generalist OCR for Ethnic Minority Languages
von: Liu, Bonan, et al.
Veröffentlicht: (2026)
von: Liu, Bonan, et al.
Veröffentlicht: (2026)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
von: Shi, Yuling, et al.
Veröffentlicht: (2026)
von: Shi, Yuling, et al.
Veröffentlicht: (2026)
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
von: Wang, Chengye, et al.
Veröffentlicht: (2026)
von: Wang, Chengye, et al.
Veröffentlicht: (2026)
GLM-OCR Technical Report
von: Duan, Shuaiqi, et al.
Veröffentlicht: (2026)
von: Duan, Shuaiqi, et al.
Veröffentlicht: (2026)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
von: Zhang, Yulong
Veröffentlicht: (2025)
von: Zhang, Yulong
Veröffentlicht: (2025)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
von: Sun, Lin, et al.
Veröffentlicht: (2026)
von: Sun, Lin, et al.
Veröffentlicht: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
von: Song, Wei, et al.
Veröffentlicht: (2025)
von: Song, Wei, et al.
Veröffentlicht: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
von: Shi, Yang, et al.
Veröffentlicht: (2025)
von: Shi, Yang, et al.
Veröffentlicht: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
von: Momayiz, Imane, et al.
Veröffentlicht: (2026)
von: Momayiz, Imane, et al.
Veröffentlicht: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
von: Wen, Shimin, et al.
Veröffentlicht: (2026)
von: Wen, Shimin, et al.
Veröffentlicht: (2026)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
von: Zhang, Junyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Junyuan, et al.
Veröffentlicht: (2024)
Agentar-Fin-OCR
von: Qian, Siyi, et al.
Veröffentlicht: (2026)
von: Qian, Siyi, et al.
Veröffentlicht: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
von: Peng, Dezhi, et al.
Veröffentlicht: (2023)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
von: Vesalainen, Ari, et al.
Veröffentlicht: (2026)
von: Vesalainen, Ari, et al.
Veröffentlicht: (2026)
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
von: Zhao, Yaqi, et al.
Veröffentlicht: (2024)
von: Zhao, Yaqi, et al.
Veröffentlicht: (2024)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
von: Taghadouini, Said, et al.
Veröffentlicht: (2026)
von: Taghadouini, Said, et al.
Veröffentlicht: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
von: He, Haibin, et al.
Veröffentlicht: (2025)
von: He, Haibin, et al.
Veröffentlicht: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
von: Li, Zhang, et al.
Veröffentlicht: (2025)
von: Li, Zhang, et al.
Veröffentlicht: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
von: He, Zhentao, et al.
Veröffentlicht: (2025)
von: He, Zhentao, et al.
Veröffentlicht: (2025)
PaddleOCR 3.0 Technical Report
von: Cui, Cheng, et al.
Veröffentlicht: (2025)
von: Cui, Cheng, et al.
Veröffentlicht: (2025)
olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
K12Vista: Exploring the Boundaries of MLLMs in K-12 Education
von: Li, Chong, et al.
Veröffentlicht: (2025)
von: Li, Chong, et al.
Veröffentlicht: (2025)
EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique
von: Zhu, Chenglin, et al.
Veröffentlicht: (2025)
von: Zhu, Chenglin, et al.
Veröffentlicht: (2025)
Multimodal OCR: Parse Anything from Documents
von: Zheng, Handong, et al.
Veröffentlicht: (2026)
von: Zheng, Handong, et al.
Veröffentlicht: (2026)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
von: Xu, Longwei, et al.
Veröffentlicht: (2026)
von: Xu, Longwei, et al.
Veröffentlicht: (2026)
olmOCR 2: Unit Test Rewards for Document OCR
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
PubMed-OCR: PMC Open Access OCR Annotations
von: Heidenreich, Hunter, et al.
Veröffentlicht: (2026)
von: Heidenreich, Hunter, et al.
Veröffentlicht: (2026)
HunyuanOCR Technical Report
von: Hunyuan Vision Team, et al.
Veröffentlicht: (2025)
von: Hunyuan Vision Team, et al.
Veröffentlicht: (2025)
OCR is All you need: Importing Multi-Modality into Image-based Defect Detection System
von: Hsu, Chih-Chung, et al.
Veröffentlicht: (2024)
von: Hsu, Chih-Chung, et al.
Veröffentlicht: (2024)
OCR-Enhanced Multimodal ASR Can Read While Listening
von: Chen, Junli, et al.
Veröffentlicht: (2026)
von: Chen, Junli, et al.
Veröffentlicht: (2026)
Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study
von: Fei, Yulin, et al.
Veröffentlicht: (2024)
von: Fei, Yulin, et al.
Veröffentlicht: (2024)
GutenOCR: A Grounded Vision-Language Front-End for Documents
von: Heidenreich, Hunter, et al.
Veröffentlicht: (2026)
von: Heidenreich, Hunter, et al.
Veröffentlicht: (2026)
Typhoon OCR: Open Vision-Language Model For Thai Document Extraction
von: Nonesung, Surapon, et al.
Veröffentlicht: (2026)
von: Nonesung, Surapon, et al.
Veröffentlicht: (2026)
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
von: Hennara, Khalil, et al.
Veröffentlicht: (2025)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
von: Cui, Cheng, et al.
Veröffentlicht: (2026)
von: Cui, Cheng, et al.
Veröffentlicht: (2026)
Towards Deployable OCR models for Indic languages
von: Mathew, Minesh, et al.
Veröffentlicht: (2022)
von: Mathew, Minesh, et al.
Veröffentlicht: (2022)
InstructOCR: Instruction Boosting Scene Text Spotting
von: Duan, Chen, et al.
Veröffentlicht: (2024)
von: Duan, Chen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
von: Chen, Qian, et al.
Veröffentlicht: (2025) -
OmniOCR: Generalist OCR for Ethnic Minority Languages
von: Liu, Bonan, et al.
Veröffentlicht: (2026) -
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026) -
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
von: Shi, Yuling, et al.
Veröffentlicht: (2026) -
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
von: Wang, Chengye, et al.
Veröffentlicht: (2026)