PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Cui, Cheng, Zhang, Yubo, Sun, Ting, Wang, Xueqing, Liu, Hongen, Lin, Manhui, Zhang, Yue, Gao, Tingquan, Zhou, Changda, Liu, Jiaxuan, Zhang, Zelun, Zhang, Jing, Zhang, Jun, Liu, Yi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
by: Cui, Cheng, et al.
Published: (2026)
by: Cui, Cheng, et al.
Published: (2026)
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
by: Cui, Cheng, et al.
Published: (2025)
by: Cui, Cheng, et al.
Published: (2025)
PaddleOCR 3.0 Technical Report
by: Cui, Cheng, et al.
Published: (2025)
by: Cui, Cheng, et al.
Published: (2025)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
by: Cui, Cheng, et al.
Published: (2026)
by: Cui, Cheng, et al.
Published: (2026)
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
by: Zhou, Changda, et al.
Published: (2026)
by: Zhou, Changda, et al.
Published: (2026)
Subkv: Quantizing Long Context KV Cache for Sub‐Billion Parameter Language Models on Edge Devices
by: Ziqian Zeng, et al.
Published: (2025)
by: Ziqian Zeng, et al.
Published: (2025)
Enhancing OCR for Sino-Vietnamese Language Processing via Fine-tuned PaddleOCRv5
by: Nguyen, Minh Hoang, et al.
Published: (2025)
by: Nguyen, Minh Hoang, et al.
Published: (2025)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
by: Sun, Quan, et al.
Published: (2024)
by: Sun, Quan, et al.
Published: (2024)
Replacement Learning: Training Vision Tasks with Fewer Learnable Parameters
by: Zhang, Yuming, et al.
Published: (2024)
by: Zhang, Yuming, et al.
Published: (2024)
Model Selection and Parameter Estimation of Multi-dimensional Gaussian Mixture Model
by: Liu, Xinyu, et al.
Published: (2026)
by: Liu, Xinyu, et al.
Published: (2026)
Model Selection and Parameter Estimation of One-Dimensional Gaussian Mixture Models
by: Liu, Xinyu, et al.
Published: (2024)
by: Liu, Xinyu, et al.
Published: (2024)
Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition
by: Liu, Hongen, et al.
Published: (2025)
by: Liu, Hongen, et al.
Published: (2025)
Reimagining Parameter Space Exploration with Diffusion Models
by: Zhang, Lijun, et al.
Published: (2025)
by: Zhang, Lijun, et al.
Published: (2025)
TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptation
by: Miao, Daiye, et al.
Published: (2025)
by: Miao, Daiye, et al.
Published: (2025)
TCFormer: A 5M-Parameter Transformer with Density-Guided Aggregation for Weakly-Supervised Crowd Counting
by: Guo, Qiang, et al.
Published: (2025)
by: Guo, Qiang, et al.
Published: (2025)
Task Allocation Algorithm and Simulation Analysis for Multiple AMRs in Digital‐Intelligent Warehouses
by: Zixia Chen, et al.
Published: (2025)
by: Zixia Chen, et al.
Published: (2025)
LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling
by: Chen, Yuxin, et al.
Published: (2026)
by: Chen, Yuxin, et al.
Published: (2026)
GroverGPT: A Large Language Model with 8 Billion Parameters for Quantum Searching
by: Wang, Haoran, et al.
Published: (2024)
by: Wang, Haoran, et al.
Published: (2024)
Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent
by: Sun, Xingwu, et al.
Published: (2024)
by: Sun, Xingwu, et al.
Published: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
by: Chen, Song, et al.
Published: (2025)
by: Chen, Song, et al.
Published: (2025)
The Rise of Parameter Specialization for Knowledge Storage in Large Language Models
by: Hong, Yihuai, et al.
Published: (2025)
by: Hong, Yihuai, et al.
Published: (2025)
Breaking the Training Barrier of Billion-Parameter Universal Machine Learning Interatomic Potentials
by: Zhou, Yuanchang, et al.
Published: (2026)
by: Zhou, Yuanchang, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey
by: Han, Zeyu, et al.
Published: (2024)
by: Han, Zeyu, et al.
Published: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
by: Liu, Yuliang, et al.
Published: (2024)
by: Liu, Yuliang, et al.
Published: (2024)
Scaling Learned Image Compression Models up to 1 Billion
by: Li, Yuqi, et al.
Published: (2025)
by: Li, Yuqi, et al.
Published: (2025)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
by: Chen, Qian, et al.
Published: (2025)
by: Chen, Qian, et al.
Published: (2025)
Sublinear Variational Optimization of Gaussian Mixture Models with Millions to Billions of Parameters
by: Salwig, Sebastian, et al.
Published: (2025)
by: Salwig, Sebastian, et al.
Published: (2025)
Augmenting Human Cognition With Generative AI: Lessons From AI-Assisted Decision-Making
by: Zhang, Zelun Tony, et al.
Published: (2025)
by: Zhang, Zelun Tony, et al.
Published: (2025)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
by: He, Haibin, et al.
Published: (2025)
by: He, Haibin, et al.
Published: (2025)
SHAKTI: A 2.5 Billion Parameter Small Language Model Optimized for Edge AI and Low-Resource Environments
by: Shakhadri, Syed Abdul Gaffar, et al.
Published: (2024)
by: Shakhadri, Syed Abdul Gaffar, et al.
Published: (2024)
GRASP: Replace Redundant Layers with Adaptive Singular Parameters for Efficient Model Compression
by: Liu, Kainan, et al.
Published: (2024)
by: Liu, Kainan, et al.
Published: (2024)
Jigsaw: Training Multi-Billion-Parameter AI Weather Models with Optimized Model Parallelism
by: Kieckhefen, Deifilia, et al.
Published: (2025)
by: Kieckhefen, Deifilia, et al.
Published: (2025)
Parameter-Efficient Conversational Recommender System as a Language Processing Task
by: Ravaut, Mathieu, et al.
Published: (2024)
by: Ravaut, Mathieu, et al.
Published: (2024)
AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
by: Cui, Yubo, et al.
Published: (2026)
by: Cui, Yubo, et al.
Published: (2026)
Scaling Diffusion Transformers to 16 Billion Parameters
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
Scaling Recommender Transformers to One Billion Parameters
by: Khrylchenko, Kirill, et al.
Published: (2025)
by: Khrylchenko, Kirill, et al.
Published: (2025)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
by: Chang, Yue, et al.
Published: (2024)
by: Chang, Yue, et al.
Published: (2024)
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
by: Shi, Yuling, et al.
Published: (2026)
by: Shi, Yuling, et al.
Published: (2026)
Similar Items
-
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
by: Cui, Cheng, et al.
Published: (2026) -
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
by: Cui, Cheng, et al.
Published: (2025) -
PaddleOCR 3.0 Technical Report
by: Cui, Cheng, et al.
Published: (2025) -
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
by: Cui, Cheng, et al.
Published: (2026) -
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
by: Zhou, Changda, et al.
Published: (2026)