Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Mannam, Varun, Wang, Fang, Chen, Xin
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866913914729529344
author Mannam, Varun
Wang, Fang
Chen, Xin
author_facet Mannam, Varun
Wang, Fang
Chen, Xin
contents Current evaluation frameworks for multimodal generative AI struggle to establish trustworthiness, hindering enterprise adoption where reliability is paramount. We introduce a systematic, quantitative benchmarking framework to measure the trustworthiness of progressively integrating cross-modal inputs such as text, images, captions, and OCR within VisualRAG systems for enterprise document intelligence. Our approach establishes quantitative relationships between technical metrics and user-centric trust measures. Evaluation reveals that optimal modality weighting with weights of 30% text, 15% image, 25% caption, and 30% OCR improves performance by 57.3% over text-only baselines while maintaining computational efficiency. We provide comparative assessments of foundation models, demonstrating their differential impact on trustworthiness in caption generation and OCR extraction-a vital consideration for reliable enterprise AI. This work advances responsible AI deployment by providing a rigorous framework for quantifying and enhancing trustworthiness in multimodal RAG for critical enterprise applications.
format Preprint
id arxiv_https___arxiv_org_abs_2506_21604
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
Mannam, Varun
Wang, Fang
Chen, Xin
Information Retrieval
Artificial Intelligence
Computer Vision and Pattern Recognition
Human-Computer Interaction
Machine Learning
Current evaluation frameworks for multimodal generative AI struggle to establish trustworthiness, hindering enterprise adoption where reliability is paramount. We introduce a systematic, quantitative benchmarking framework to measure the trustworthiness of progressively integrating cross-modal inputs such as text, images, captions, and OCR within VisualRAG systems for enterprise document intelligence. Our approach establishes quantitative relationships between technical metrics and user-centric trust measures. Evaluation reveals that optimal modality weighting with weights of 30% text, 15% image, 25% caption, and 30% OCR improves performance by 57.3% over text-only baselines while maintaining computational efficiency. We provide comparative assessments of foundation models, demonstrating their differential impact on trustworthiness in caption generation and OCR extraction-a vital consideration for reliable enterprise AI. This work advances responsible AI deployment by providing a rigorous framework for quantifying and enhancing trustworthiness in multimodal RAG for critical enterprise applications.
title Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
topic Information Retrieval
Artificial Intelligence
Computer Vision and Pattern Recognition
Human-Computer Interaction
Machine Learning
url https://arxiv.org/abs/2506.21604