DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Wenhui, Wang, Jiapeng, Li, Hongliang, Wang, Chengyu, Huang, Jun, Jin, Lianwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
di: Huang, Jiaxi, et al.
Pubblicazione: (2025)
di: Huang, Jiaxi, et al.
Pubblicazione: (2025)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
di: Li, Hongliang, et al.
Pubblicazione: (2025)
di: Li, Hongliang, et al.
Pubblicazione: (2025)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
di: Xia, Renqiu, et al.
Pubblicazione: (2024)
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
di: Huang, Kui, et al.
Pubblicazione: (2025)
di: Huang, Kui, et al.
Pubblicazione: (2025)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
PEneo: Unifying Line Extraction, Line Grouping, and Entity Linking for End-to-end Document Pair Extraction
di: Lin, Zening, et al.
Pubblicazione: (2024)
di: Lin, Zening, et al.
Pubblicazione: (2024)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
di: Liao, Pan, et al.
Pubblicazione: (2026)
di: Liao, Pan, et al.
Pubblicazione: (2026)
URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding
di: Shi, Yongxin, et al.
Pubblicazione: (2025)
di: Shi, Yongxin, et al.
Pubblicazione: (2025)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
di: Wang, An-Lan, et al.
Pubblicazione: (2025)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
di: Hu, Anwen, et al.
Pubblicazione: (2024)
di: Hu, Anwen, et al.
Pubblicazione: (2024)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
di: Zheng, Xiangtian, et al.
Pubblicazione: (2026)
di: Zheng, Xiangtian, et al.
Pubblicazione: (2026)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
LEGO: Self-Supervised Representation Learning for Scene Text Images
di: Ren, Yujin, et al.
Pubblicazione: (2024)
di: Ren, Yujin, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025)
di: Fu, Pei, et al.
Pubblicazione: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
di: Feng, Hao, et al.
Pubblicazione: (2023)
di: Feng, Hao, et al.
Pubblicazione: (2023)
DocRefine: An Intelligent Framework for Scientific Document Understanding and Content Optimization based on Multimodal Large Model Agents
di: Qian, Kun, et al.
Pubblicazione: (2025)
di: Qian, Kun, et al.
Pubblicazione: (2025)
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
di: Jain, Chelsi, et al.
Pubblicazione: (2025)
di: Jain, Chelsi, et al.
Pubblicazione: (2025)
MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding
di: Chen, Ketong, et al.
Pubblicazione: (2025)
di: Chen, Ketong, et al.
Pubblicazione: (2025)
HSD: Training-Free Acceleration for Document Parsing Vision-Language Model with Hierarchical Speculative Decoding
di: Liao, Wenhui, et al.
Pubblicazione: (2026)
di: Liao, Wenhui, et al.
Pubblicazione: (2026)
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
di: Hannan, Tanveer, et al.
Pubblicazione: (2025)
Privacy-Preserving Biometric Verification with Handwritten Random Digit String
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
di: Ni, Feng, et al.
Pubblicazione: (2025)
di: Ni, Feng, et al.
Pubblicazione: (2025)
DocRevive: A Unified Pipeline for Document Text Restoration
di: Purkayastha, Kunal, et al.
Pubblicazione: (2026)
di: Purkayastha, Kunal, et al.
Pubblicazione: (2026)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
di: Huang, Wencan, et al.
Pubblicazione: (2025)
di: Huang, Wencan, et al.
Pubblicazione: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
di: Wang, Jiapeng, et al.
Pubblicazione: (2024) -
DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
di: Wang, Jiapeng, et al.
Pubblicazione: (2024) -
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024) -
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
di: Huang, Jiaxi, et al.
Pubblicazione: (2025) -
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
di: Li, Hongliang, et al.
Pubblicazione: (2025)