UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Xiangyu, Qin, Can, Chen, Zeyuan, Xu, Ran, Xiong, Caiming, Wu, Chien-Sheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025)
di: Meng, Rui, et al.
Pubblicazione: (2025)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
di: Ji, Yifan, et al.
Pubblicazione: (2026)
di: Ji, Yifan, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025)
di: Wang, Zekun, et al.
Pubblicazione: (2025)
UEval: A Benchmark for Unified Multimodal Generation
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing
di: Su, Xiaoyan, et al.
Pubblicazione: (2026)
di: Su, Xiaoyan, et al.
Pubblicazione: (2026)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
di: Yang, Cheng, et al.
Pubblicazione: (2026)
di: Yang, Cheng, et al.
Pubblicazione: (2026)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
di: Yang, Luyu, et al.
Pubblicazione: (2026)
di: Yang, Luyu, et al.
Pubblicazione: (2026)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
di: Li, Zichao, et al.
Pubblicazione: (2024)
di: Li, Zichao, et al.
Pubblicazione: (2024)
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
di: Yu, Ning, et al.
Pubblicazione: (2022)
di: Yu, Ning, et al.
Pubblicazione: (2022)
HIVE: Harnessing Human Feedback for Instructional Visual Editing
di: Zhang, Shu, et al.
Pubblicazione: (2023)
di: Zhang, Shu, et al.
Pubblicazione: (2023)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
di: Wang, Bin, et al.
Pubblicazione: (2026)
di: Wang, Bin, et al.
Pubblicazione: (2026)
UniChange: Unifying Change Detection with Multimodal Large Language Model
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
di: Wu, Yin, et al.
Pubblicazione: (2025)
di: Wu, Yin, et al.
Pubblicazione: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis
di: Zhao, Zengqi, et al.
Pubblicazione: (2026)
di: Zhao, Zengqi, et al.
Pubblicazione: (2026)
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
di: Li, Chenxu, et al.
Pubblicazione: (2025)
di: Li, Chenxu, et al.
Pubblicazione: (2025)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval
di: Kriz, Reno, et al.
Pubblicazione: (2024)
di: Kriz, Reno, et al.
Pubblicazione: (2024)
Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
di: Niu, Yuwei, et al.
Pubblicazione: (2025)
di: Niu, Yuwei, et al.
Pubblicazione: (2025)
RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models
di: Lee, Segyu, et al.
Pubblicazione: (2026)
di: Lee, Segyu, et al.
Pubblicazione: (2026)
xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
di: Xue, Le, et al.
Pubblicazione: (2024)
di: Xue, Le, et al.
Pubblicazione: (2024)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
di: Anugraha, David, et al.
Pubblicazione: (2025)
di: Anugraha, David, et al.
Pubblicazione: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
di: Xu, Shilin, et al.
Pubblicazione: (2025)
di: Xu, Shilin, et al.
Pubblicazione: (2025)
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
di: Ryoo, Michael S., et al.
Pubblicazione: (2024)
di: Ryoo, Michael S., et al.
Pubblicazione: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
di: Xu, Mengya, et al.
Pubblicazione: (2025)
di: Xu, Mengya, et al.
Pubblicazione: (2025)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024)
di: Yu, Shi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
di: Peng, Xiangyu, et al.
Pubblicazione: (2026) -
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025) -
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
di: Ji, Yifan, et al.
Pubblicazione: (2026) -
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025) -
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024)