CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Zhipeng, Ji, Junhao, Chen, Zulong, Liu, Zhenghao, Liu, Qing, Peng, Chunyi, Qin, Zubao, Xu, Ze, Wan, Jianqiang, Tang, Jun, Yang, Zhibo, Bai, Shuai, Liu, Dayiheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
by: Yang, Zhibo, et al.
Published: (2024)
by: Yang, Zhibo, et al.
Published: (2024)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
by: Ji, Yifan, et al.
Published: (2026)
by: Ji, Yifan, et al.
Published: (2026)
Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy
by: Ma, Denghao, et al.
Published: (2026)
by: Ma, Denghao, et al.
Published: (2026)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
by: Xiong, Yuqi, et al.
Published: (2026)
by: Xiong, Yuqi, et al.
Published: (2026)
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
by: Zhu, Fanwei, et al.
Published: (2025)
by: Zhu, Fanwei, et al.
Published: (2025)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
by: Liu, Yuliang, et al.
Published: (2024)
by: Liu, Yuliang, et al.
Published: (2024)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
by: Yang, Yehui, et al.
Published: (2026)
by: Yang, Yehui, et al.
Published: (2026)
Multimodal OCR: Parse Anything from Documents
by: Zheng, Handong, et al.
Published: (2026)
by: Zheng, Handong, et al.
Published: (2026)
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation
by: Peng, Chunyi, et al.
Published: (2025)
by: Peng, Chunyi, et al.
Published: (2025)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
by: Li, Zhang, et al.
Published: (2026)
by: Li, Zhang, et al.
Published: (2026)
Enhancing the Patent Matching Capability of Large Language Models via the Memory Graph
by: Xiong, Qiushi, et al.
Published: (2025)
by: Xiong, Qiushi, et al.
Published: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
by: Yu, Wenwen, et al.
Published: (2025)
by: Yu, Wenwen, et al.
Published: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
by: Yu, Wenwen, et al.
Published: (2025)
by: Yu, Wenwen, et al.
Published: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
by: Guan, Shuhao, et al.
Published: (2025)
by: Guan, Shuhao, et al.
Published: (2025)
4DGS-CC: A Contextual Coding Framework for 4D Gaussian Splatting Data Compression
by: Chen, Zicong, et al.
Published: (2025)
by: Chen, Zicong, et al.
Published: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
by: Liu, Yuliang, et al.
Published: (2023)
by: Liu, Yuliang, et al.
Published: (2023)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
by: Li, Chunyi, et al.
Published: (2024)
by: Li, Chunyi, et al.
Published: (2024)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
by: Li, Mingxin, et al.
Published: (2026)
by: Li, Mingxin, et al.
Published: (2026)
SEAL: Structure and Element Aware Learning to Improve Long Structured Document Retrieval
by: Huang, Xinhao, et al.
Published: (2025)
by: Huang, Xinhao, et al.
Published: (2025)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
by: Xu, Zhipeng, et al.
Published: (2024)
by: Xu, Zhipeng, et al.
Published: (2024)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
by: Zhang, Peirong, et al.
Published: (2025)
by: Zhang, Peirong, et al.
Published: (2025)
Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents
by: Greif, Gavin, et al.
Published: (2025)
by: Greif, Gavin, et al.
Published: (2025)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
by: Yu, Shi, et al.
Published: (2024)
by: Yu, Shi, et al.
Published: (2024)
Auditing M-LLMs for Privacy Risks: A Synthetic Benchmark and Evaluation Framework
by: Li, Junhao, et al.
Published: (2025)
by: Li, Junhao, et al.
Published: (2025)
MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing
by: Zhou, Bangbang, et al.
Published: (2026)
by: Zhou, Bangbang, et al.
Published: (2026)
Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
by: Chen, Zixin, et al.
Published: (2026)
by: Chen, Zixin, et al.
Published: (2026)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
by: Huang, Pengcheng, et al.
Published: (2025)
by: Huang, Pengcheng, et al.
Published: (2025)
DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation
by: Huang, Xinhao, et al.
Published: (2026)
by: Huang, Xinhao, et al.
Published: (2026)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking
by: Ji, Yifan, et al.
Published: (2025)
by: Ji, Yifan, et al.
Published: (2025)
ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering
by: Wei, Jingxuan, et al.
Published: (2025)
by: Wei, Jingxuan, et al.
Published: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
by: Li, Zhang, et al.
Published: (2025)
by: Li, Zhang, et al.
Published: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
by: He, Zhentao, et al.
Published: (2025)
by: He, Zhentao, et al.
Published: (2025)
Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance
by: Li, Jihang, et al.
Published: (2026)
by: Li, Jihang, et al.
Published: (2026)
Intelligent Approval of Access Control Flow in Office Automation Systems via Relational Modeling
by: Liu, Dugang, et al.
Published: (2026)
by: Liu, Dugang, et al.
Published: (2026)
RETAIL: Towards Real-world Travel Planning for Large Language Models
by: Deng, Bin, et al.
Published: (2025)
by: Deng, Bin, et al.
Published: (2025)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
by: Gagnier, Henry, et al.
Published: (2026)
by: Gagnier, Henry, et al.
Published: (2026)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
by: Shi, Yang, et al.
Published: (2025)
by: Shi, Yang, et al.
Published: (2025)
From Pen to Pixel: Translating Hand-Drawn Plots into Graphical APIs via a Novel Benchmark and Efficient Adapter
by: Xu, Zhenghao, et al.
Published: (2026)
by: Xu, Zhenghao, et al.
Published: (2026)
Similar Items
-
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
by: Yang, Zhibo, et al.
Published: (2024) -
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
by: Ji, Yifan, et al.
Published: (2026) -
Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy
by: Ma, Denghao, et al.
Published: (2026) -
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
by: Xiong, Yuqi, et al.
Published: (2026) -
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
by: Yang, Hao, et al.
Published: (2026)