Deep Learning based Visually Rich Document Content Understanding: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Yihao, Han, Soyeon Caren, Lee, Jean, Hovy, Eduard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2025)
di: Ding, Yihao, et al.
Pubblicazione: (2025)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning
di: Zhao, Haoran, et al.
Pubblicazione: (2026)
di: Zhao, Haoran, et al.
Pubblicazione: (2026)
SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
MSG-Chart: Multimodal Scene Graph for ChartQA
di: Dai, Yue, et al.
Pubblicazione: (2024)
di: Dai, Yue, et al.
Pubblicazione: (2024)
SynDoc: A Hybrid Discriminative-Generative Framework for Enhancing Synthetic Domain-Adaptive Document Key Information Extraction
di: Ding, Yihao, et al.
Pubblicazione: (2025)
di: Ding, Yihao, et al.
Pubblicazione: (2025)
A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
di: Ding, Yihao, et al.
Pubblicazione: (2025)
di: Ding, Yihao, et al.
Pubblicazione: (2025)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
di: Wang, Eileen, et al.
Pubblicazione: (2024)
di: Wang, Eileen, et al.
Pubblicazione: (2024)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
di: Xu, Hongshen, et al.
Pubblicazione: (2024)
Graph Neural Networks for Text Classification: A Survey
di: Wang, Kunze, et al.
Pubblicazione: (2023)
di: Wang, Kunze, et al.
Pubblicazione: (2023)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
SparrowVQE: Visual Question Explanation for Course Content Understanding
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
di: Chung, Jiwan, et al.
Pubblicazione: (2024)
di: Chung, Jiwan, et al.
Pubblicazione: (2024)
BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence
di: Xiang, Biao, et al.
Pubblicazione: (2026)
di: Xiang, Biao, et al.
Pubblicazione: (2026)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
di: Xiao, Han, et al.
Pubblicazione: (2025)
di: Xiao, Han, et al.
Pubblicazione: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
di: Zhu, Wang, et al.
Pubblicazione: (2023)
di: Zhu, Wang, et al.
Pubblicazione: (2023)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
di: Gao, Sensen, et al.
Pubblicazione: (2025)
di: Gao, Sensen, et al.
Pubblicazione: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
di: Fujitake, Masato
Pubblicazione: (2024)
di: Fujitake, Masato
Pubblicazione: (2024)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
di: Hwang, Taebaek, et al.
Pubblicazione: (2025)
di: Hwang, Taebaek, et al.
Pubblicazione: (2025)
Automatic Layout Planning for Visually-Rich Documents with Instruction-Following Models
di: Zhu, Wanrong, et al.
Pubblicazione: (2024)
di: Zhu, Wanrong, et al.
Pubblicazione: (2024)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
Large Content And Behavior Models To Understand, Simulate, And Optimize Content And Behavior
di: Khandelwal, Ashmit, et al.
Pubblicazione: (2023)
di: Khandelwal, Ashmit, et al.
Pubblicazione: (2023)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
di: Yu, Xinmiao, et al.
Pubblicazione: (2024)
di: Yu, Xinmiao, et al.
Pubblicazione: (2024)
Internalized Reasoning for Long-Context Visual Document Understanding
di: Veselka, Austin
Pubblicazione: (2026)
di: Veselka, Austin
Pubblicazione: (2026)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
di: Le, Binh M., et al.
Pubblicazione: (2025)
di: Le, Binh M., et al.
Pubblicazione: (2025)
Video Understanding with Large Language Models: A Survey
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
Teaching Human Behavior Improves Content Understanding Abilities Of LLMs
di: Singh, Somesh, et al.
Pubblicazione: (2024)
di: Singh, Somesh, et al.
Pubblicazione: (2024)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
di: Yang, Yue, et al.
Pubblicazione: (2025)
di: Yang, Yue, et al.
Pubblicazione: (2025)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
VISaGE: Understanding Visual Generics and Exceptions
di: Frank, Stella, et al.
Pubblicazione: (2025)
di: Frank, Stella, et al.
Pubblicazione: (2025)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
di: Tanaka, Ryota, et al.
Pubblicazione: (2025)
di: Tanaka, Ryota, et al.
Pubblicazione: (2025)
Documenti analoghi
-
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2024) -
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2025) -
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024) -
When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning
di: Zhao, Haoran, et al.
Pubblicazione: (2026) -
SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction
di: Ding, Yihao, et al.
Pubblicazione: (2024)