MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Hejun, Niu, Junbo, Wang, Bin, Zeng, Weijun, Zhang, Wentao, He, Conghui |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
by: Wang, Bin, et al.
Published: (2026)
by: Wang, Bin, et al.
Published: (2026)
MinerU: An Open-Source Solution for Precise Document Content Extraction
by: Wang, Bin, et al.
Published: (2024)
by: Wang, Bin, et al.
Published: (2024)
MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
by: Xu, Bangrui, et al.
Published: (2026)
by: Xu, Bangrui, et al.
Published: (2026)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
by: Niu, Junbo, et al.
Published: (2025)
by: Niu, Junbo, et al.
Published: (2025)
Uni-Renderer: Unifying Rendering and Inverse Rendering Via Dual Stream Diffusion
by: Chen, Zhifei, et al.
Published: (2024)
by: Chen, Zhifei, et al.
Published: (2024)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
by: Niu, Junbo, et al.
Published: (2025)
by: Niu, Junbo, et al.
Published: (2025)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
by: Zhang, Junyuan, et al.
Published: (2024)
by: Zhang, Junyuan, et al.
Published: (2024)
DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models
by: Liang, Ruofan, et al.
Published: (2025)
by: Liang, Ruofan, et al.
Published: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
by: Wang, Zhengren, et al.
Published: (2026)
by: Wang, Zhengren, et al.
Published: (2026)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
by: Zhang, Qintong, et al.
Published: (2025)
by: Zhang, Qintong, et al.
Published: (2025)
DNF-Intrinsic: Deterministic Noise-Free Diffusion for Indoor Inverse Rendering
by: Zheng, Rongjia, et al.
Published: (2025)
by: Zheng, Rongjia, et al.
Published: (2025)
MaterialFusion: Enhancing Inverse Rendering with Material Diffusion Priors
by: Litman, Yehonathan, et al.
Published: (2024)
by: Litman, Yehonathan, et al.
Published: (2024)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
by: Liang, Hao, et al.
Published: (2025)
by: Liang, Hao, et al.
Published: (2025)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
by: Ma, Dongsheng, et al.
Published: (2026)
by: Ma, Dongsheng, et al.
Published: (2026)
Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
by: Sun, Shanlin, et al.
Published: (2025)
by: Sun, Shanlin, et al.
Published: (2025)
Channel-wise Noise Scheduled Diffusion for Inverse Rendering in Indoor Scenes
by: Choi, JunYong, et al.
Published: (2025)
by: Choi, JunYong, et al.
Published: (2025)
Diffusion Reflectance Map: Single-Image Stochastic Inverse Rendering of Illumination and Reflectance
by: Enyo, Yuto, et al.
Published: (2023)
by: Enyo, Yuto, et al.
Published: (2023)
IntrinsicAnything: Learning Diffusion Priors for Inverse Rendering Under Unknown Illumination
by: Chen, Xi, et al.
Published: (2024)
by: Chen, Xi, et al.
Published: (2024)
Photorealistic Object Insertion with Diffusion-Guided Inverse Rendering
by: Liang, Ruofan, et al.
Published: (2024)
by: Liang, Ruofan, et al.
Published: (2024)
PICD: Versatile Perceptual Image Compression with Diffusion Rendering
by: Xu, Tongda, et al.
Published: (2025)
by: Xu, Tongda, et al.
Published: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
DODO: Discrete OCR Diffusion Models
by: Man, Sean, et al.
Published: (2026)
by: Man, Sean, et al.
Published: (2026)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
by: Peng, Yibo, et al.
Published: (2026)
by: Peng, Yibo, et al.
Published: (2026)
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
by: Zou, Chang, et al.
Published: (2024)
by: Zou, Chang, et al.
Published: (2024)
Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework
by: Shi, Linxiao, et al.
Published: (2026)
by: Shi, Linxiao, et al.
Published: (2026)
Multimodal OCR: Parse Anything from Documents
by: Zheng, Handong, et al.
Published: (2026)
by: Zheng, Handong, et al.
Published: (2026)
DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception
by: Zhao, Zhiyuan, et al.
Published: (2024)
by: Zhao, Zhiyuan, et al.
Published: (2024)
SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering
by: Niu, Jiahao, et al.
Published: (2026)
by: Niu, Jiahao, et al.
Published: (2026)
Many-Worlds Inverse Rendering
by: Zhang, Ziyi, et al.
Published: (2024)
by: Zhang, Ziyi, et al.
Published: (2024)
TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance
by: Ye, Keren, et al.
Published: (2025)
by: Ye, Keren, et al.
Published: (2025)
Demystifying Numerosity in Diffusion Models -- Limitations and Remedies
by: Zhao, Yaqi, et al.
Published: (2025)
by: Zhao, Yaqi, et al.
Published: (2025)
Denoising Monte Carlo Renders with Diffusion Models
by: Vavilala, Vaibhav, et al.
Published: (2024)
by: Vavilala, Vaibhav, et al.
Published: (2024)
TensoIR: Tensorial Inverse Rendering
by: Jin, Haian, et al.
Published: (2023)
by: Jin, Haian, et al.
Published: (2023)
HairDiffusion: Vivid Multi-Colored Hair Editing via Latent Diffusion
by: Zeng, Yu, et al.
Published: (2024)
by: Zeng, Yu, et al.
Published: (2024)
Denoising Diffusion via Image-Based Rendering
by: Anciukevičius, Titas, et al.
Published: (2024)
by: Anciukevičius, Titas, et al.
Published: (2024)
HuGDiffusion: Generalizable Single-Image Human Rendering via 3D Gaussian Diffusion
by: Tang, Yingzhi, et al.
Published: (2025)
by: Tang, Yingzhi, et al.
Published: (2025)
EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
by: Lu, Runnan, et al.
Published: (2025)
by: Lu, Runnan, et al.
Published: (2025)
GIR: 3D Gaussian Inverse Rendering for Relightable Scene Factorization
by: Shi, Yahao, et al.
Published: (2023)
by: Shi, Yahao, et al.
Published: (2023)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
by: Liu, Zheng, et al.
Published: (2025)
by: Liu, Zheng, et al.
Published: (2025)
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
by: Kang, Hengrui, et al.
Published: (2025)
by: Kang, Hengrui, et al.
Published: (2025)
Similar Items
-
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
by: Wang, Bin, et al.
Published: (2026) -
MinerU: An Open-Source Solution for Precise Document Content Extraction
by: Wang, Bin, et al.
Published: (2024) -
MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
by: Xu, Bangrui, et al.
Published: (2026) -
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
by: Niu, Junbo, et al.
Published: (2025) -
Uni-Renderer: Unifying Rendering and Inverse Rendering Via Dual Stream Diffusion
by: Chen, Zhifei, et al.
Published: (2024)