VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Jian, Li, Ming, Kil, Jihyung, Wang, Chenguang, Yu, Tong, Rossi, Ryan, Zhou, Tianyi, Chen, Changyou, Zhang, Ruiyi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
par: Törtei, Brigitta Malagurski, et autres
Publié: (2025)
par: Törtei, Brigitta Malagurski, et autres
Publié: (2025)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
MMR: Evaluating Reading Ability of Large Multimodal Models
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation
par: Suri, Manan, et autres
Publié: (2024)
par: Suri, Manan, et autres
Publié: (2024)
Towards Aligned Layout Generation via Diffusion Model with Aesthetic Constraints
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
Anticipatory Planning for Multimodal AI Agents
par: Liang, Yongyuan, et autres
Publié: (2026)
par: Liang, Yongyuan, et autres
Publié: (2026)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
par: Mai, Zheda, et autres
Publié: (2025)
par: Mai, Zheda, et autres
Publié: (2025)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
par: Ma, Yubo, et autres
Publié: (2024)
par: Ma, Yubo, et autres
Publié: (2024)
TRINS: Towards Multimodal Language Models that Can Read
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing
par: Lin, Zihao, et autres
Publié: (2026)
par: Lin, Zihao, et autres
Publié: (2026)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
par: Zhou, Shijie, et autres
Publié: (2024)
par: Zhou, Shijie, et autres
Publié: (2024)
RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations
par: Chen, I-Hsiang, et autres
Publié: (2026)
par: Chen, I-Hsiang, et autres
Publié: (2026)
Augmenting Textual Generation via Topology Aware Retrieval
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
par: Byun, Ju-Seung, et autres
Publié: (2024)
par: Byun, Ju-Seung, et autres
Publié: (2024)
Text-Conditioned Background Generation for Editable Multi-Layer Documents
par: Kang, Taewon, et autres
Publié: (2025)
par: Kang, Taewon, et autres
Publié: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
Dual-View Visual Contextualization for Web Navigation
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Understanding Retrieval Augmentation for Long-Form Question Answering
par: Chen, Hung-Ting, et autres
Publié: (2023)
par: Chen, Hung-Ting, et autres
Publié: (2023)
VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations
par: Xie, Yupeng, et autres
Publié: (2025)
par: Xie, Yupeng, et autres
Publié: (2025)
VisKnow: Constructing Visual Knowledge Base for Object Understanding
par: Yao, Ziwei, et autres
Publié: (2025)
par: Yao, Ziwei, et autres
Publié: (2025)
TextLap: Customizing Language Models for Text-to-Layout Planning
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
par: Lim, Hyeonseok, et autres
Publié: (2024)
par: Lim, Hyeonseok, et autres
Publié: (2024)
MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation Systems
par: Thakur, Nandan, et autres
Publié: (2024)
par: Thakur, Nandan, et autres
Publié: (2024)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
par: Ji, Haonian, et autres
Publié: (2025)
par: Ji, Haonian, et autres
Publié: (2025)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
GPT-4V(ision) is a Generalist Web Agent, if Grounded
par: Zheng, Boyuan, et autres
Publié: (2024)
par: Zheng, Boyuan, et autres
Publié: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
par: Zhu, Dawei, et autres
Publié: (2025)
par: Zhu, Dawei, et autres
Publié: (2025)
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
par: Choi, Jae Young, et autres
Publié: (2026)
par: Choi, Jae Young, et autres
Publié: (2026)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
par: Li, Yinglu, et autres
Publié: (2025)
par: Li, Yinglu, et autres
Publié: (2025)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
par: Yan, Yibo, et autres
Publié: (2026)
par: Yan, Yibo, et autres
Publié: (2026)
RuleR: Improving LLM Controllability by Rule-based Data Recycling
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
VisMin: Visual Minimal-Change Understanding
par: Awal, Rabiul, et autres
Publié: (2024)
par: Awal, Rabiul, et autres
Publié: (2024)
An Empirical Study of Retrieval-Augmented Code Generation: Challenges and Opportunities
par: Yang, Zezhou, et autres
Publié: (2025)
par: Yang, Zezhou, et autres
Publié: (2025)
Documents similaires
-
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
par: Törtei, Brigitta Malagurski, et autres
Publié: (2025) -
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
par: Chen, Jian, et autres
Publié: (2024) -
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025) -
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
par: Chen, Jian, et autres
Publié: (2025) -
MMR: Evaluating Reading Ability of Large Multimodal Models
par: Chen, Jian, et autres
Publié: (2024)