Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Yin, Kun, Wu, Yunfei, Liu, Bing, Cai, Zhongpeng, Li, Xiaotian, Chen, Huang, Li, Xin, Cao, Haoyu, Liu, Yinsong, Jiang, Deqiang, Sun, Xing, Wu, Yunsheng, Li, Qianyu, Guo, Antai, Liao, Yanzhen, Qu, Yanqiu, Lin, Haodong, He, Chengxu, Liu, Shuangyin
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866917227282825216
author Yin, Kun
Wu, Yunfei
Liu, Bing
Cai, Zhongpeng
Li, Xiaotian
Chen, Huang
Li, Xin
Cao, Haoyu
Liu, Yinsong
Jiang, Deqiang
Sun, Xing
Wu, Yunsheng
Li, Qianyu
Guo, Antai
Liao, Yanzhen
Qu, Yanqiu
Lin, Haodong
He, Chengxu
Liu, Shuangyin
author_facet Yin, Kun
Wu, Yunfei
Liu, Bing
Cai, Zhongpeng
Li, Xiaotian
Chen, Huang
Li, Xin
Cao, Haoyu
Liu, Yinsong
Jiang, Deqiang
Sun, Xing
Wu, Yunsheng
Li, Qianyu
Guo, Antai
Liao, Yanzhen
Qu, Yanqiu
Lin, Haodong
He, Chengxu
Liu, Shuangyin
contents This paper presents Youtu-Parsing, an efficient and versatile document parsing model designed for high-performance content extraction. The architecture employs a native Vision Transformer (ViT) featuring a dynamic-resolution visual encoder to extract shared document features, coupled with a prompt-guided Youtu-LLM-2B language model for layout analysis and region-prompted decoding. Leveraging this decoupled and feature-reusable framework, we introduce a high-parallelism decoding strategy comprising two core components: token parallelism and query parallelism. The token parallelism strategy concurrently generates up to 64 candidate tokens per inference step, which are subsequently validated through a verification mechanism. This approach yields a 5--11x speedup over traditional autoregressive decoding and is particularly well-suited for highly structured scenarios, such as table recognition. To further exploit the advantages of region-prompted decoding, the query parallelism strategy enables simultaneous content prediction for multiple bounding boxes (up to five), providing an additional 2x acceleration while maintaining output quality equivalent to standard decoding. Youtu-Parsing encompasses a diverse range of document elements, including text, formulas, tables, charts, seals, and hierarchical structures. Furthermore, the model exhibits strong robustness when handling rare characters, multilingual text, and handwritten content. Extensive evaluations demonstrate that Youtu-Parsing achieves state-of-the-art (SOTA) performance on both the OmniDocBench and olmOCR-bench benchmarks. Overall, Youtu-Parsing demonstrates significant experimental value and practical utility for large-scale document intelligence applications.
format Preprint
id arxiv_https___arxiv_org_abs_2601_20430
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
Yin, Kun
Wu, Yunfei
Liu, Bing
Cai, Zhongpeng
Li, Xiaotian
Chen, Huang
Li, Xin
Cao, Haoyu
Liu, Yinsong
Jiang, Deqiang
Sun, Xing
Wu, Yunsheng
Li, Qianyu
Guo, Antai
Liao, Yanzhen
Qu, Yanqiu
Lin, Haodong
He, Chengxu
Liu, Shuangyin
Computer Vision and Pattern Recognition
This paper presents Youtu-Parsing, an efficient and versatile document parsing model designed for high-performance content extraction. The architecture employs a native Vision Transformer (ViT) featuring a dynamic-resolution visual encoder to extract shared document features, coupled with a prompt-guided Youtu-LLM-2B language model for layout analysis and region-prompted decoding. Leveraging this decoupled and feature-reusable framework, we introduce a high-parallelism decoding strategy comprising two core components: token parallelism and query parallelism. The token parallelism strategy concurrently generates up to 64 candidate tokens per inference step, which are subsequently validated through a verification mechanism. This approach yields a 5--11x speedup over traditional autoregressive decoding and is particularly well-suited for highly structured scenarios, such as table recognition. To further exploit the advantages of region-prompted decoding, the query parallelism strategy enables simultaneous content prediction for multiple bounding boxes (up to five), providing an additional 2x acceleration while maintaining output quality equivalent to standard decoding. Youtu-Parsing encompasses a diverse range of document elements, including text, formulas, tables, charts, seals, and hierarchical structures. Furthermore, the model exhibits strong robustness when handling rare characters, multilingual text, and handwritten content. Extensive evaluations demonstrate that Youtu-Parsing achieves state-of-the-art (SOTA) performance on both the OmniDocBench and olmOCR-bench benchmarks. Overall, Youtu-Parsing demonstrates significant experimental value and practical utility for large-scale document intelligence applications.
title Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2601.20430