Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI
Fuente:
arXiv
Saved in:
| Main Authors: | Singh, Saurabh K., Raj, Sachin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unified Multimodal Interleaved Document Representation for Retrieval
by: Lee, Jaewoo, et al.
Published: (2024)
by: Lee, Jaewoo, et al.
Published: (2024)
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
by: Opsahl-Ong, Krista, et al.
Published: (2026)
by: Opsahl-Ong, Krista, et al.
Published: (2026)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
by: Wu, Hui, et al.
Published: (2026)
by: Wu, Hui, et al.
Published: (2026)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
by: Khanghah, Kiarash Naghavi, et al.
Published: (2026)
by: Khanghah, Kiarash Naghavi, et al.
Published: (2026)
FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents
by: Thakur, Nandan, et al.
Published: (2025)
by: Thakur, Nandan, et al.
Published: (2025)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
by: Su, Weihang, et al.
Published: (2025)
by: Su, Weihang, et al.
Published: (2025)
Transformers Remember First, Forget Last: Dual-Process Interference in LLMs
by: Chattaraj, Sourav, et al.
Published: (2026)
by: Chattaraj, Sourav, et al.
Published: (2026)
HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches
by: Tan, Jiejun, et al.
Published: (2025)
by: Tan, Jiejun, et al.
Published: (2025)
The Synergy of Automated Pipelines with Prompt Engineering and Generative AI in Web Crawling
by: Huang, Chau-Jian
Published: (2024)
by: Huang, Chau-Jian
Published: (2024)
Benchmarking Information Retrieval Models on Complex Retrieval Tasks
by: Killingback, Julian, et al.
Published: (2025)
by: Killingback, Julian, et al.
Published: (2025)
Structured Attention Matters to Multimodal LLMs in Document Understanding
by: Liu, Chang, et al.
Published: (2025)
by: Liu, Chang, et al.
Published: (2025)
Reason to Contrast: A Cascaded Multimodal Retrieval Framework
by: Cui, Xuanming, et al.
Published: (2025)
by: Cui, Xuanming, et al.
Published: (2025)
SwasthLLM: a Unified Cross-Lingual, Multi-Task, and Meta-Learning Zero-Shot Framework for Medical Diagnosis Using Contrastive Representations
by: Sar, Ayan, et al.
Published: (2025)
by: Sar, Ayan, et al.
Published: (2025)
QAEA-DR: A Unified Text Augmentation Framework for Dense Retrieval
by: Tan, Hongming, et al.
Published: (2024)
by: Tan, Hongming, et al.
Published: (2024)
Model-Document Protocol for AI Search
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
by: Islamaj, Rezarta, et al.
Published: (2026)
by: Islamaj, Rezarta, et al.
Published: (2026)
TURA: Tool-Augmented Unified Retrieval Agent for AI Search
by: Zhao, Zhejun, et al.
Published: (2025)
by: Zhao, Zhejun, et al.
Published: (2025)
A Semi-supervised Scalable Unified Framework for E-commerce Query Classification
by: Yuan, Chunyuan, et al.
Published: (2025)
by: Yuan, Chunyuan, et al.
Published: (2025)
FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents
by: Kim, Eric Y., et al.
Published: (2026)
by: Kim, Eric Y., et al.
Published: (2026)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
by: Su, Weihang, et al.
Published: (2025)
by: Su, Weihang, et al.
Published: (2025)
Towards Personalized Deep Research: Benchmarks and Evaluations
by: Liang, Yuan, et al.
Published: (2025)
by: Liang, Yuan, et al.
Published: (2025)
Still Fresh? Evaluating Temporal Drift in Retrieval Benchmarks
by: Kuissi, Nathan, et al.
Published: (2026)
by: Kuissi, Nathan, et al.
Published: (2026)
On the impact of retrieved content representations in RAG Pipelines
by: Ross, Jonathan J, et al.
Published: (2026)
by: Ross, Jonathan J, et al.
Published: (2026)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
by: Wu, Yutao, et al.
Published: (2025)
by: Wu, Yutao, et al.
Published: (2025)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
by: Dong, Kuicai, et al.
Published: (2025)
by: Dong, Kuicai, et al.
Published: (2025)
Bias-Aware Agent: Enhancing Fairness in AI-Driven Knowledge Retrieval
by: Singh, Karanbir, et al.
Published: (2025)
by: Singh, Karanbir, et al.
Published: (2025)
Optimizing RAG Pipelines for Arabic: A Systematic Analysis of Core Components
by: Alsubhi, Jumana, et al.
Published: (2025)
by: Alsubhi, Jumana, et al.
Published: (2025)
A Semantic Search Pipeline for Causality-driven Adhoc Information Retrieval
by: Dalal, Dhairya, et al.
Published: (2025)
by: Dalal, Dhairya, et al.
Published: (2025)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
by: Wu, Kaifeng, et al.
Published: (2025)
by: Wu, Kaifeng, et al.
Published: (2025)
Fine-tuning Small Language Models as Efficient Enterprise Search Relevance Labelers
by: Kang, Yue, et al.
Published: (2026)
by: Kang, Yue, et al.
Published: (2026)
Enhancing Question Answering for Enterprise Knowledge Bases using Large Language Models
by: Jiang, Feihu, et al.
Published: (2024)
by: Jiang, Feihu, et al.
Published: (2024)
The Text Classification Pipeline: Starting Shallow going Deeper
by: Siino, Marco, et al.
Published: (2024)
by: Siino, Marco, et al.
Published: (2024)
Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models
by: Sun, Qiang, et al.
Published: (2024)
by: Sun, Qiang, et al.
Published: (2024)
Reconstructing Context: Evaluating Advanced Chunking Strategies for Retrieval-Augmented Generation
by: Merola, Carlo, et al.
Published: (2025)
by: Merola, Carlo, et al.
Published: (2025)
EnterpriseEM: Fine-tuned Embeddings for Enterprise Semantic Search
by: Rathinasamy, Kamalkumar, et al.
Published: (2024)
by: Rathinasamy, Kamalkumar, et al.
Published: (2024)
Evaluating Multimodal Large Language Models on Educational Textbook Question Answering
by: Alawwad, Hessa A., et al.
Published: (2025)
by: Alawwad, Hessa A., et al.
Published: (2025)
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
by: Markowitz, Elan, et al.
Published: (2025)
by: Markowitz, Elan, et al.
Published: (2025)
A Framework for Leveraging Partially-Labeled Data for Product Attribute-Value Identification
by: Subhalingam, D., et al.
Published: (2024)
by: Subhalingam, D., et al.
Published: (2024)
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
by: Li, Zhuofeng, et al.
Published: (2026)
by: Li, Zhuofeng, et al.
Published: (2026)
Improving Robustness of Tabular Retrieval via Representational Stability
by: Bhandari, Kushal Raj, et al.
Published: (2026)
by: Bhandari, Kushal Raj, et al.
Published: (2026)
Similar Items
-
Unified Multimodal Interleaved Document Representation for Retrieval
by: Lee, Jaewoo, et al.
Published: (2024) -
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
by: Opsahl-Ong, Krista, et al.
Published: (2026) -
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
by: Wu, Hui, et al.
Published: (2026) -
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
by: Khanghah, Kiarash Naghavi, et al.
Published: (2026) -
FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents
by: Thakur, Nandan, et al.
Published: (2025)