A Multi-Granularity Retrieval Framework for Visually-Rich Documents
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Mingjun, Wang, Zehui, Cai, Hengxing, Zhong, Renxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
di: Kim, Juyeon, et al.
Pubblicazione: (2025)
di: Kim, Juyeon, et al.
Pubblicazione: (2025)
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
di: Xiao, Bin, et al.
Pubblicazione: (2023)
di: Xiao, Bin, et al.
Pubblicazione: (2023)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
di: Tanaka, Ryota, et al.
Pubblicazione: (2025)
di: Tanaka, Ryota, et al.
Pubblicazione: (2025)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
Towards Human-Like Machine Comprehension: Few-Shot Relational Learning in Visually-Rich Documents
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Benchmark Granularity and Model Robustness for Image-Text Retrieval
di: Hendriksen, Mariya, et al.
Pubblicazione: (2024)
di: Hendriksen, Mariya, et al.
Pubblicazione: (2024)
Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization
di: Bach, Duong
Pubblicazione: (2025)
di: Bach, Duong
Pubblicazione: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
di: Deng, Chenlong, et al.
Pubblicazione: (2026)
di: Deng, Chenlong, et al.
Pubblicazione: (2026)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
di: Molina, Adrià, et al.
Pubblicazione: (2024)
di: Molina, Adrià, et al.
Pubblicazione: (2024)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
Composed Multi-modal Retrieval: A Survey of Approaches and Applications
di: Zhang, Kun, et al.
Pubblicazione: (2025)
di: Zhang, Kun, et al.
Pubblicazione: (2025)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval
di: Zhang, Weihang, et al.
Pubblicazione: (2025)
di: Zhang, Weihang, et al.
Pubblicazione: (2025)
AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction
di: Yang, Jiashu, et al.
Pubblicazione: (2026)
di: Yang, Jiashu, et al.
Pubblicazione: (2026)
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024)
di: Yu, Shi, et al.
Pubblicazione: (2024)
Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document Retrieval
di: Lim, Ho Hung, et al.
Pubblicazione: (2026)
di: Lim, Ho Hung, et al.
Pubblicazione: (2026)
Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval
di: Lu, Xuan, et al.
Pubblicazione: (2026)
di: Lu, Xuan, et al.
Pubblicazione: (2026)
GBSK: Skeleton Clustering via Granular-ball Computing and Multi-Sampling for Large-Scale Data
di: Chen, Yewang, et al.
Pubblicazione: (2025)
di: Chen, Yewang, et al.
Pubblicazione: (2025)
NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
RAGAR: Retrieval Augmented Personalized Image Generation Guided by Recommendation
di: Ling, Run, et al.
Pubblicazione: (2025)
di: Ling, Run, et al.
Pubblicazione: (2025)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
di: Huang, Jinghao, et al.
Pubblicazione: (2025)
di: Huang, Jinghao, et al.
Pubblicazione: (2025)
MTMD: A Multi-Task Multi-Domain Framework for Unified Ad Lightweight Ranking at Pinterest
di: Yang, Xiao, et al.
Pubblicazione: (2025)
di: Yang, Xiao, et al.
Pubblicazione: (2025)
Heterogeneous Graph-based Framework with Disentangled Representations Learning for Multi-target Cross Domain Recommendation
di: Liu, Xiaopeng, et al.
Pubblicazione: (2024)
di: Liu, Xiaopeng, et al.
Pubblicazione: (2024)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
Interactive Multi-Turn Retrieval for Health Videos
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
di: Kim, Juyeon, et al.
Pubblicazione: (2025) -
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
di: Xu, Mingjun, et al.
Pubblicazione: (2025) -
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
di: Xiao, Bin, et al.
Pubblicazione: (2023) -
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
di: Tanaka, Ryota, et al.
Pubblicazione: (2025) -
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)