Salvato in:
| Autori principali: | Xu, Bangrui, Miao, Ziyang, Zhou, Xuanhe, Lin, Yiming, Tang, Zirui, Zhao, Xiaomeng, Wu, Fan, Tan, Cheng, Wang, Bin, He, Conghui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.24973 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
di: Wang, Bin, et al.
Pubblicazione: (2026)
di: Wang, Bin, et al.
Pubblicazione: (2026)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
MinerU: An Open-Source Solution for Precise Document Content Extraction
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
MoDora: Tree-Based Semi-Structured Document Analysis System
di: Xu, Bangrui, et al.
Pubblicazione: (2026)
di: Xu, Bangrui, et al.
Pubblicazione: (2026)
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
di: Dong, Hejun, et al.
Pubblicazione: (2026)
di: Dong, Hejun, et al.
Pubblicazione: (2026)
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
di: Zhang, Qintong, et al.
Pubblicazione: (2024)
di: Zhang, Qintong, et al.
Pubblicazione: (2024)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
di: Tian, Juanxi, et al.
Pubblicazione: (2025)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
di: Wang, Zhengren, et al.
Pubblicazione: (2026)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2026)
di: Feng, Hao, et al.
Pubblicazione: (2026)
Logics-Parsing Technical Report
di: Chen, Xiangyang, et al.
Pubblicazione: (2025)
di: Chen, Xiangyang, et al.
Pubblicazione: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
di: Li, Huilai, et al.
Pubblicazione: (2026)
di: Li, Huilai, et al.
Pubblicazione: (2026)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs
di: Zhou, Wei, et al.
Pubblicazione: (2026)
di: Zhou, Wei, et al.
Pubblicazione: (2026)
Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
di: Song, Jiahe, et al.
Pubblicazione: (2026)
di: Song, Jiahe, et al.
Pubblicazione: (2026)
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
LLM/Agent-as-Data-Analyst: A Survey
di: Tang, Zirui, et al.
Pubblicazione: (2025)
di: Tang, Zirui, et al.
Pubblicazione: (2025)
Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
di: Feng, Hao, et al.
Pubblicazione: (2025)
di: Feng, Hao, et al.
Pubblicazione: (2025)
A Survey of LLM $\times$ DATA
di: Zhou, Xuanhe, et al.
Pubblicazione: (2025)
di: Zhou, Xuanhe, et al.
Pubblicazione: (2025)
Document Author Classification Using Parsed Language Structure
di: Moon, Todd K, et al.
Pubblicazione: (2024)
di: Moon, Todd K, et al.
Pubblicazione: (2024)
PARROT: A Benchmark for Evaluating LLMs in Cross-System SQL Translation
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
di: Fan, Jiahe, et al.
Pubblicazione: (2026)
di: Fan, Jiahe, et al.
Pubblicazione: (2026)
DualMap: Online Open-Vocabulary Semantic Mapping for Natural Language Navigation in Dynamic Changing Scenes
di: Jiang, Jiajun, et al.
Pubblicazione: (2025)
di: Jiang, Jiajun, et al.
Pubblicazione: (2025)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
ParseBench: A Document Parsing Benchmark for AI Agents
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
Learning AND-OR Templates for Professional Photograph Parsing and Guidance
di: Jin, Xin, et al.
Pubblicazione: (2024)
di: Jin, Xin, et al.
Pubblicazione: (2024)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
di: Li, Zhang, et al.
Pubblicazione: (2026)
di: Li, Zhang, et al.
Pubblicazione: (2026)
Rep2Text: Decoding Full Text from a Single LLM Token Representation
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
AceParse: A Comprehensive Dataset with Diverse Structured Texts for Academic Literature Parsing
di: Ji, Huawei, et al.
Pubblicazione: (2024)
di: Ji, Huawei, et al.
Pubblicazione: (2024)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
di: Song, Jiahe, et al.
Pubblicazione: (2025)
di: Song, Jiahe, et al.
Pubblicazione: (2025)
Lexicalized Constituency Parsing for Middle Dutch: Low-resource Training and Cross-Domain Generalization
di: Liang, Yiming, et al.
Pubblicazione: (2026)
di: Liang, Yiming, et al.
Pubblicazione: (2026)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
di: Wang, Baode, et al.
Pubblicazione: (2025)
di: Wang, Baode, et al.
Pubblicazione: (2025)
DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2024)
Improving Dialogue Discourse Parsing through Discourse-aware Utterance Clarification
di: Fan, Yaxin, et al.
Pubblicazione: (2025)
di: Fan, Yaxin, et al.
Pubblicazione: (2025)
Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing
di: Qi, Fan, et al.
Pubblicazione: (2025)
di: Qi, Fan, et al.
Pubblicazione: (2025)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
di: Fang, Haipeng, et al.
Pubblicazione: (2025)
di: Fang, Haipeng, et al.
Pubblicazione: (2025)
Parsing of Research Documents into XML Using Formal Grammars
di: Opeoluwa Iwashokun, et al.
Pubblicazione: (2024)
di: Opeoluwa Iwashokun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
di: Wang, Bin, et al.
Pubblicazione: (2026) -
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
di: Niu, Junbo, et al.
Pubblicazione: (2025) -
MinerU: An Open-Source Solution for Precise Document Content Extraction
di: Wang, Bin, et al.
Pubblicazione: (2024) -
MoDora: Tree-Based Semi-Structured Document Analysis System
di: Xu, Bangrui, et al.
Pubblicazione: (2026) -
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
di: Dong, Hejun, et al.
Pubblicazione: (2026)