Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Haiyang, Wu, Yuchuan, Shi, Fan, Liao, Lei, Lu, Jinghui, Ge, Xiaodong, Wang, Han, Zhuo, Minghan, Wu, Xuecheng, Fei, Xiang, Feng, Hao, Tang, Guozhi, Wang, An-Lan, Zhu, Hanshen, He, Yangfan, Liang, Quanhuan, Meng, Liyuan, Feng, Chao, Huang, Can, Tang, Jingqun, Li, Bin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
by: Zhu, Hanshen, et al.
Published: (2026)
by: Zhu, Hanshen, et al.
Published: (2026)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
by: Nie, Yuxiang, et al.
Published: (2025)
by: Nie, Yuxiang, et al.
Published: (2025)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
by: Shan, Bin, et al.
Published: (2024)
by: Shan, Bin, et al.
Published: (2024)
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
by: Lu, Jinghui, et al.
Published: (2025)
by: Lu, Jinghui, et al.
Published: (2025)
Advancing Sequential Numerical Prediction in Autoregressive Models
by: Fei, Xiang, et al.
Published: (2025)
by: Fei, Xiang, et al.
Published: (2025)
ParGo: Bridging Vision-Language with Partial and Global Views
by: Wang, An-Lan, et al.
Published: (2024)
by: Wang, An-Lan, et al.
Published: (2024)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
by: Lu, Jinghui, et al.
Published: (2024)
by: Lu, Jinghui, et al.
Published: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
by: Wang, An-Lan, et al.
Published: (2025)
by: Wang, An-Lan, et al.
Published: (2025)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
by: Feng, Hao, et al.
Published: (2026)
by: Feng, Hao, et al.
Published: (2026)
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
by: Jia, Weitao, et al.
Published: (2025)
by: Jia, Weitao, et al.
Published: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
by: Xue, Wei, et al.
Published: (2026)
by: Xue, Wei, et al.
Published: (2026)
PRevivor: Reviving Ancient Chinese Paintings using Prior-Guided Color Transformers
by: Tang, Tan, et al.
Published: (2025)
by: Tang, Tan, et al.
Published: (2025)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
by: Feng, Hao, et al.
Published: (2025)
by: Feng, Hao, et al.
Published: (2025)
Vision as LoRA
by: Wang, Han, et al.
Published: (2025)
by: Wang, Han, et al.
Published: (2025)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
by: Wu, Yuchuan, et al.
Published: (2026)
by: Wu, Yuchuan, et al.
Published: (2026)
Towards Ancient Plant Seed Classification: A Benchmark Dataset and Baseline Model
by: Xing, Rui, et al.
Published: (2025)
by: Xing, Rui, et al.
Published: (2025)
AMR-CCR: Anchored Modular Retrieval for Continual Chinese Character Recognition
by: Wu, Yuchuan, et al.
Published: (2026)
by: Wu, Yuchuan, et al.
Published: (2026)
CHisIEC: An Information Extraction Corpus for Ancient Chinese History
by: Tang, Xuemei, et al.
Published: (2024)
by: Tang, Xuemei, et al.
Published: (2024)
Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
by: Han, Minghao, et al.
Published: (2025)
by: Han, Minghao, et al.
Published: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
by: Feng, Hao, et al.
Published: (2023)
by: Feng, Hao, et al.
Published: (2023)
CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
by: Niu, Ke, et al.
Published: (2025)
by: Niu, Ke, et al.
Published: (2025)
Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters
by: Li, Gengluo, et al.
Published: (2026)
by: Li, Gengluo, et al.
Published: (2026)
AgentOCR: Reimagining Agent History via Optical Self-Compression
by: Feng, Lang, et al.
Published: (2026)
by: Feng, Lang, et al.
Published: (2026)
SynergyKGC: Reconciling Topological Heterogeneity in Knowledge Graph Completion via Topology-Aware Synergy
by: Zou, Xuecheng, et al.
Published: (2026)
by: Zou, Xuecheng, et al.
Published: (2026)
Therapeutic strategies for aberrant splicing in cancer and genetic disorders
by: Wenhua Shi, et al.
Published: (2024)
by: Wenhua Shi, et al.
Published: (2024)
MOA: Multi-Objective Alignment for Role-Playing Agents
by: Liao, Chonghua, et al.
Published: (2025)
by: Liao, Chonghua, et al.
Published: (2025)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
by: Yu, Haiyang, et al.
Published: (2025)
by: Yu, Haiyang, et al.
Published: (2025)
TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy
by: Zhao, Weichao, et al.
Published: (2024)
by: Zhao, Weichao, et al.
Published: (2024)
A Mini‐Review on Chinese Ancient Porcelain Research: Application of EDXRF Technology in Archaeology and Cultural Heritage Conservation
by: Fei Li, et al.
Published: (2025)
by: Fei Li, et al.
Published: (2025)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
by: Tang, Jingqun, et al.
Published: (2024)
by: Tang, Jingqun, et al.
Published: (2024)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
by: Li, Chenyang, et al.
Published: (2026)
by: Li, Chenyang, et al.
Published: (2026)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
by: Tang, Jingqun, et al.
Published: (2024)
by: Tang, Jingqun, et al.
Published: (2024)
Exploring the Capabilities of ChatGPT in Ancient Chinese Translation and Person Name Recognition
by: Si, Shijing, et al.
Published: (2023)
by: Si, Shijing, et al.
Published: (2023)
Key Coverage Matters: Semi-Structured Extraction of OCR Clinical Reports
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
by: Tang, Haocheng, et al.
Published: (2026)
by: Tang, Haocheng, et al.
Published: (2026)
CauTraj: A Causal-Knowledge-Guided Framework for Lane-Changing Trajectory Planning of Autonomous Vehicles
by: Lei, Cailin, et al.
Published: (2025)
by: Lei, Cailin, et al.
Published: (2025)
P‐7.1: The Principle of IJP OCR Mura and Adjustment Method
by: Mingjie Tang, et al.
Published: (2025)
by: Mingjie Tang, et al.
Published: (2025)
Global solution of 2D hyperbolic liquid crystal system for small initial data
by: Wang, Xuecheng
Published: (2024)
by: Wang, Xuecheng
Published: (2024)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
by: Xue, Junxiao, et al.
Published: (2025)
by: Xue, Junxiao, et al.
Published: (2025)
HunyuanOCR Technical Report
by: Hunyuan Vision Team, et al.
Published: (2025)
by: Hunyuan Vision Team, et al.
Published: (2025)
Similar Items
-
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
by: Zhu, Hanshen, et al.
Published: (2026) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
by: Nie, Yuxiang, et al.
Published: (2025) -
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
by: Shan, Bin, et al.
Published: (2024) -
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
by: Lu, Jinghui, et al.
Published: (2025) -
Advancing Sequential Numerical Prediction in Autoregressive Models
by: Fei, Xiang, et al.
Published: (2025)