mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Anwen, Xu, Haiyang, Ye, Jiabo, Yan, Ming, Zhang, Liang, Zhang, Bo, Li, Chen, Zhang, Ji, Jin, Qin, Huang, Fei, Zhou, Jingren |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024)
di: Hu, Anwen, et al.
Pubblicazione: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning
di: Mo, Ye, et al.
Pubblicazione: (2025)
di: Mo, Ye, et al.
Pubblicazione: (2025)
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
di: Yan, Hao, et al.
Pubblicazione: (2026)
di: Yan, Hao, et al.
Pubblicazione: (2026)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
Key Coverage Matters: Semi-Structured Extraction of OCR Clinical Reports
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
CogDoc: Towards Unified thinking in Documents
di: Xu, Qixin, et al.
Pubblicazione: (2025)
di: Xu, Qixin, et al.
Pubblicazione: (2025)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning
di: Li, Xiao-Hui, et al.
Pubblicazione: (2025)
di: Li, Xiao-Hui, et al.
Pubblicazione: (2025)
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
DocRevive: A Unified Pipeline for Document Text Restoration
di: Purkayastha, Kunal, et al.
Pubblicazione: (2026)
di: Purkayastha, Kunal, et al.
Pubblicazione: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
di: Peng, Dezhi, et al.
Pubblicazione: (2023)
DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering
di: Lin, Teng, et al.
Pubblicazione: (2026)
di: Lin, Teng, et al.
Pubblicazione: (2026)
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
di: Dong, Daxiang, et al.
Pubblicazione: (2026)
di: Dong, Daxiang, et al.
Pubblicazione: (2026)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
Multimodal OCR: Parse Anything from Documents
di: Zheng, Handong, et al.
Pubblicazione: (2026)
di: Zheng, Handong, et al.
Pubblicazione: (2026)
DocDancer: Towards Agentic Document-Grounded Information Seeking
di: Zhang, Qintong, et al.
Pubblicazione: (2026)
di: Zhang, Qintong, et al.
Pubblicazione: (2026)
The Owl
Pubblicazione: (2021)
Pubblicazione: (2021)
ScaleDoc: Scaling LLM-based Predicates over Large Document Collections
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
DocMamba: Efficient Document Pre-training with State Space Model
di: Hu, Pengfei, et al.
Pubblicazione: (2024)
di: Hu, Pengfei, et al.
Pubblicazione: (2024)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
AgentOCR: Reimagining Agent History via Optical Self-Compression
di: Feng, Lang, et al.
Pubblicazione: (2026)
di: Feng, Lang, et al.
Pubblicazione: (2026)
A Unified Understanding of the Experimental Controlling of the T$_\text{c}$ of La$_3$Ni$_2$O$_7$
di: Chen, Zeyu, et al.
Pubblicazione: (2026)
di: Chen, Zeyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024) -
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024) -
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023) -
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023) -
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)