Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Gengluo, Lyu, Pengyuan, Zhang, Chengquan, Shen, Huawen, Wu, Liang, Wan, Xingyu, Zeng, Gangyan, Hu, Han, Ma, Can, Zhou, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts
par: Li, Gengluo, et autres
Publié: (2025)
par: Li, Gengluo, et autres
Publié: (2025)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
par: Zhang, Yan, et autres
Publié: (2024)
par: Zhang, Yan, et autres
Publié: (2024)
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
par: Shen, Huawen, et autres
Publié: (2024)
par: Shen, Huawen, et autres
Publié: (2024)
Towards Training-Free Scene Text Editing
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
Towards Unified Multi-granularity Text Detection with Interactive Attention
par: Wan, Xingyu, et autres
Publié: (2024)
par: Wan, Xingyu, et autres
Publié: (2024)
Falcon-UI: Understanding GUI Before Following User Instructions
par: Shen, Huawen, et autres
Publié: (2024)
par: Shen, Huawen, et autres
Publié: (2024)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
par: Zhang, Yan, et autres
Publié: (2025)
par: Zhang, Yan, et autres
Publié: (2025)
Recognition-Synergistic Scene Text Editing
par: Fang, Zhengyao, et autres
Publié: (2025)
par: Fang, Zhengyao, et autres
Publié: (2025)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
par: Lyu, Jiahao, et autres
Publié: (2024)
par: Lyu, Jiahao, et autres
Publié: (2024)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
par: Li, Zhang, et autres
Publié: (2026)
par: Li, Zhang, et autres
Publié: (2026)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
par: Lyu, Pengyuan, et autres
Publié: (2024)
par: Lyu, Pengyuan, et autres
Publié: (2024)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
par: Guo, Hao, et autres
Publié: (2025)
par: Guo, Hao, et autres
Publié: (2025)
S-INF: Towards Realistic Indoor Scene Synthesis via Scene Implicit Neural Field
par: Liang, Zixi, et autres
Publié: (2024)
par: Liang, Zixi, et autres
Publié: (2024)
Beyond Detection: A Structure-Aware Framework for Scene Text Tracking
par: Yu, Chenmin, et autres
Publié: (2026)
par: Yu, Chenmin, et autres
Publié: (2026)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
Char-SAM: Turning Segment Anything Model into Scene Text Segmentation Annotator with Character-level Visual Prompts
par: Xie, Enze, et autres
Publié: (2024)
par: Xie, Enze, et autres
Publié: (2024)
Multimodal OCR: Parse Anything from Documents
par: Zheng, Handong, et autres
Publié: (2026)
par: Zheng, Handong, et autres
Publié: (2026)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
par: Fang, Zhengyao, et autres
Publié: (2026)
par: Fang, Zhengyao, et autres
Publié: (2026)
Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
par: Feng, Hao, et autres
Publié: (2025)
par: Feng, Hao, et autres
Publié: (2025)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
par: Xu, Pengxin, et autres
Publié: (2026)
par: Xu, Pengxin, et autres
Publié: (2026)
PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations
par: Sun, Haowen, et autres
Publié: (2025)
par: Sun, Haowen, et autres
Publié: (2025)
Deep Reinforcement Learning for Solving the Fleet Size and Mix Vehicle Routing Problem
par: Wan, Pengfu, et autres
Publié: (2025)
par: Wan, Pengfu, et autres
Publié: (2025)
HSD: Training-Free Acceleration for Document Parsing Vision-Language Model with Hierarchical Speculative Decoding
par: Liao, Wenhui, et autres
Publié: (2026)
par: Liao, Wenhui, et autres
Publié: (2026)
ParseBench: A Document Parsing Benchmark for AI Agents
par: Zhang, Boyang, et autres
Publié: (2026)
par: Zhang, Boyang, et autres
Publié: (2026)
Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition
par: Wu, Daiqing, et autres
Publié: (2024)
par: Wu, Daiqing, et autres
Publié: (2024)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
par: Zhang, Yan, et autres
Publié: (2026)
par: Zhang, Yan, et autres
Publié: (2026)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
par: Li, Zhiheng, et autres
Publié: (2026)
par: Li, Zhiheng, et autres
Publié: (2026)
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
par: Wu, Jingjing, et autres
Publié: (2024)
par: Wu, Jingjing, et autres
Publié: (2024)
MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing
par: Zhou, Bangbang, et autres
Publié: (2026)
par: Zhou, Bangbang, et autres
Publié: (2026)
PhoneWorld: Scaling Phone-Use Agent Environments
par: Tang, Zhengyang, et autres
Publié: (2026)
par: Tang, Zhengyang, et autres
Publié: (2026)
Towards Realistic Data Generation for Real-World Super-Resolution
par: Peng, Long, et autres
Publié: (2024)
par: Peng, Long, et autres
Publié: (2024)
DocFusion: A Unified Framework for Document Parsing Tasks
par: Chai, Mingxu, et autres
Publié: (2024)
par: Chai, Mingxu, et autres
Publié: (2024)
TreeForm: End-to-end Annotation and Evaluation for Form Document Parsing
par: Zmigrod, Ran, et autres
Publié: (2024)
par: Zmigrod, Ran, et autres
Publié: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
par: Tang, Zihan, et autres
Publié: (2026)
par: Tang, Zihan, et autres
Publié: (2026)
Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters
par: Li, Gengluo, et autres
Publié: (2026)
par: Li, Gengluo, et autres
Publié: (2026)
Rubber Tube–Based Triboelectric Nanogenerator for Simultaneous Energy Harvesting and Real‐Time Health Monitoring in Taekwondo Athletes
par: Chengquan Piao, et autres
Publié: (2026)
par: Chengquan Piao, et autres
Publié: (2026)
Applying Unsupervised Semantic Segmentation to High-Resolution UAV Imagery for Enhanced Road Scene Parsing
par: Ma, Zihan, et autres
Publié: (2024)
par: Ma, Zihan, et autres
Publié: (2024)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
par: Feng, Hao, et autres
Publié: (2026)
par: Feng, Hao, et autres
Publié: (2026)
Documents similaires
-
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
par: Li, Gengluo, et autres
Publié: (2026) -
Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts
par: Li, Gengluo, et autres
Publié: (2025) -
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
par: Zhang, Yan, et autres
Publié: (2024) -
LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled Pretraining
par: Shen, Huawen, et autres
Publié: (2024) -
Towards Training-Free Scene Text Editing
par: Li, Yubo, et autres
Publié: (2026)