Structured Attention Matters to Multimodal LLMs in Document Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Chang, Chen, Hongkai, Cai, Yujun, Wu, Hang, Ye, Qingwen, Yang, Ming-Hsuan, Wang, Yiwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Manager: Parallel Agent Loop for Long-form Deep Research
par: Xu, Yilong, et autres
Publié: (2026)
par: Xu, Yilong, et autres
Publié: (2026)
LITA: An Efficient LLM-assisted Iterative Topic Augmentation Framework
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
par: Chang, Chia-Hsuan, et autres
Publié: (2024)
Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
par: Lan, Junwei, et autres
Publié: (2025)
par: Lan, Junwei, et autres
Publié: (2025)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
par: Wu, Hui, et autres
Publié: (2026)
par: Wu, Hui, et autres
Publié: (2026)
Unified Multimodal Interleaved Document Representation for Retrieval
par: Lee, Jaewoo, et autres
Publié: (2024)
par: Lee, Jaewoo, et autres
Publié: (2024)
Self-Describing Structured Data with Dual-Layer Guidance: A Lightweight Alternative to RAG for Precision Retrieval in Large-Scale LLM Knowledge Navigation
par: Liu, Hung Ming
Publié: (2026)
par: Liu, Hung Ming
Publié: (2026)
M-$LLM^3$REC: A Motivation-Aware User-Item Interaction Framework for Enhancing Recommendation Accuracy with LLMs
par: Chen, Lining, et autres
Publié: (2025)
par: Chen, Lining, et autres
Publié: (2025)
Doc2SAR: A Synergistic Framework for High-Fidelity Extraction of Structure-Activity Relationships from Scientific Documents
par: Zhuang, Jiaxi, et autres
Publié: (2025)
par: Zhuang, Jiaxi, et autres
Publié: (2025)
Multimodal Quantitative Language for Generative Recommendation
par: Zhai, Jianyang, et autres
Publié: (2025)
par: Zhai, Jianyang, et autres
Publié: (2025)
LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing
par: Ma, Bo, et autres
Publié: (2025)
par: Ma, Bo, et autres
Publié: (2025)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
par: Hu, Caiyu, et autres
Publié: (2025)
par: Hu, Caiyu, et autres
Publié: (2025)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
par: Khanghah, Kiarash Naghavi, et autres
Publié: (2026)
par: Khanghah, Kiarash Naghavi, et autres
Publié: (2026)
Rankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation
par: Balog, Krisztian, et autres
Publié: (2025)
par: Balog, Krisztian, et autres
Publié: (2025)
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
par: Wang, Ziliang, et autres
Publié: (2025)
par: Wang, Ziliang, et autres
Publié: (2025)
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
par: Wang, Ziliang, et autres
Publié: (2025)
par: Wang, Ziliang, et autres
Publié: (2025)
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
par: Su, Weihang, et autres
Publié: (2026)
par: Su, Weihang, et autres
Publié: (2026)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
par: Wu, Kaifeng, et autres
Publié: (2025)
par: Wu, Kaifeng, et autres
Publié: (2025)
AttentionRetriever: Attention Layers are Secretly Long Document Retrievers
par: Fu, David Jiahao, et autres
Publié: (2026)
par: Fu, David Jiahao, et autres
Publié: (2026)
Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI
par: Singh, Saurabh K., et autres
Publié: (2026)
par: Singh, Saurabh K., et autres
Publié: (2026)
Tuning LLMs by RAG Principles: Towards LLM-native Memory
par: Wei, Jiale, et autres
Publié: (2025)
par: Wei, Jiale, et autres
Publié: (2025)
Retrieval-Augmented LLMs for Evidence Localization in Clinical Trial Recruitment from Longitudinal EHR Narratives
par: Chen, Ziyi, et autres
Publié: (2026)
par: Chen, Ziyi, et autres
Publié: (2026)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
par: Wu, Yutao, et autres
Publié: (2025)
par: Wu, Yutao, et autres
Publié: (2025)
DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search
par: Li, Zhanli, et autres
Publié: (2026)
par: Li, Zhanli, et autres
Publié: (2026)
Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Quantifying Document Impact in RAG-LLMs
par: Gerami, Armin, et autres
Publié: (2025)
par: Gerami, Armin, et autres
Publié: (2025)
CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG
par: Tian, Yang, et autres
Publié: (2025)
par: Tian, Yang, et autres
Publié: (2025)
Cross-Modal Attention Network with Dual Graph Learning in Multimodal Recommendation
par: Dai, Ji, et autres
Publié: (2026)
par: Dai, Ji, et autres
Publié: (2026)
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
par: Yang, Hang, et autres
Publié: (2024)
par: Yang, Hang, et autres
Publié: (2024)
FineTuneBench: How well do commercial fine-tuning APIs infuse knowledge into LLMs?
par: Wu, Eric, et autres
Publié: (2024)
par: Wu, Eric, et autres
Publié: (2024)
Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
par: Tavakoli, Mohammad, et autres
Publié: (2025)
par: Tavakoli, Mohammad, et autres
Publié: (2025)
Model-Document Protocol for AI Search
par: Qian, Hongjin, et autres
Publié: (2025)
par: Qian, Hongjin, et autres
Publié: (2025)
TableRAG: Million-Token Table Understanding with Language Models
par: Chen, Si-An, et autres
Publié: (2024)
par: Chen, Si-An, et autres
Publié: (2024)
Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
par: Ye, Fangda, et autres
Publié: (2026)
par: Ye, Fangda, et autres
Publié: (2026)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
CLI-RAG: A Retrieval-Augmented Framework for Clinically Structured and Context Aware Text Generation with LLMs
par: Keerthana, Garapati, et autres
Publié: (2025)
par: Keerthana, Garapati, et autres
Publié: (2025)
Optimizing Multi-Hop Document Retrieval Through Intermediate Representations
par: Lin, Jiaen, et autres
Publié: (2025)
par: Lin, Jiaen, et autres
Publié: (2025)
Evidence-Grounded Multimodal Misinformation Detection with Attention-Based GNNs
par: Duwal, Sharad, et autres
Publié: (2025)
par: Duwal, Sharad, et autres
Publié: (2025)
Do LLMs Understand Collaborative Signals? Diagnosis and Repair
par: Pouryousef, Shahrooz, et autres
Publié: (2025)
par: Pouryousef, Shahrooz, et autres
Publié: (2025)
Beyond path selection: Better LLMs for Scientific Information Extraction with MimicSFT and Relevance and Rule-induced(R$^2$)GRPO
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Documents similaires
-
Self-Manager: Parallel Agent Loop for Long-form Deep Research
par: Xu, Yilong, et autres
Publié: (2026) -
LITA: An Efficient LLM-assisted Iterative Topic Augmentation Framework
par: Chang, Chia-Hsuan, et autres
Publié: (2024) -
Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
par: Lan, Junwei, et autres
Publié: (2025) -
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
par: Wu, Hui, et autres
Publié: (2026) -
Unified Multimodal Interleaved Document Representation for Retrieval
par: Lee, Jaewoo, et autres
Publié: (2024)