mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Anwen, Xu, Haiyang, Zhang, Liang, Ye, Jiabo, Yan, Ming, Zhang, Ji, Jin, Qin, Huang, Fei, Zhou, Jingren |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024)
di: Hu, Anwen, et al.
Pubblicazione: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
di: Al-Homoud, Haneen, et al.
Pubblicazione: (2025)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning
di: Mo, Ye, et al.
Pubblicazione: (2025)
di: Mo, Ye, et al.
Pubblicazione: (2025)
AgentOCR: Reimagining Agent History via Optical Self-Compression
di: Feng, Lang, et al.
Pubblicazione: (2026)
di: Feng, Lang, et al.
Pubblicazione: (2026)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
di: Liu, Chenglong, et al.
Pubblicazione: (2024)
di: Liu, Chenglong, et al.
Pubblicazione: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
di: Zhang, Zhihan, et al.
Pubblicazione: (2023)
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
di: Yan, Hao, et al.
Pubblicazione: (2026)
di: Yan, Hao, et al.
Pubblicazione: (2026)
Key Coverage Matters: Semi-Structured Extraction of OCR Clinical Reports
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
The Owl
Pubblicazione: (2021)
Pubblicazione: (2021)
Multimodal OCR: Parse Anything from Documents
di: Zheng, Handong, et al.
Pubblicazione: (2026)
di: Zheng, Handong, et al.
Pubblicazione: (2026)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
di: Zhang, Jiarui, et al.
Pubblicazione: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models
di: Li, Jierui, et al.
Pubblicazione: (2023)
di: Li, Jierui, et al.
Pubblicazione: (2023)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
Less is More: DocString Compression in Code Generation
di: Yang, Guang, et al.
Pubblicazione: (2024)
di: Yang, Guang, et al.
Pubblicazione: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
di: Le, Binh M., et al.
Pubblicazione: (2025)
di: Le, Binh M., et al.
Pubblicazione: (2025)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
di: Dua, Karan, et al.
Pubblicazione: (2025)
di: Dua, Karan, et al.
Pubblicazione: (2025)
DocDancer: Towards Agentic Document-Grounded Information Seeking
di: Zhang, Qintong, et al.
Pubblicazione: (2026)
di: Zhang, Qintong, et al.
Pubblicazione: (2026)
PLUG: Revisiting Amodal Segmentation with Foundation Model and Hierarchical Focus
di: Liu, Zhaochen, et al.
Pubblicazione: (2024)
di: Liu, Zhaochen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024) -
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024) -
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023) -
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023) -
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
di: Benmahane, Yahya, et al.
Pubblicazione: (2025)