Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Yan, Yibo, Ou, Mingdong, Cao, Yi, Zou, Xin, Huo, Jiahao, Liu, Shuliang, Kwok, James, Hu, Xuming
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866908977451761664
author Yan, Yibo
Ou, Mingdong
Cao, Yi
Zou, Xin
Huo, Jiahao
Liu, Shuliang
Kwok, James
Hu, Xuming
author_facet Yan, Yibo
Ou, Mingdong
Cao, Yi
Zou, Xin
Huo, Jiahao
Liu, Shuliang
Kwok, James
Hu, Xuming
contents Visual Document Retrieval (VDR), which aims to retrieve relevant pages within vast corpora of visually-rich documents, is of significance in current multimodal retrieval applications. The state-of-the-art multi-vector paradigm excels in performance but suffers from prohibitive overhead, a problem that current efficiency methods like pruning and merging address imperfectly, creating a difficult trade-off between compression rate and feature fidelity. To overcome this dilemma, we introduce Prune-then-Merge, a novel two-stage framework that synergizes these complementary approaches. Our method first employs an adaptive pruning stage to filter out low-information patches, creating a refined, high-signal set of embeddings. Subsequently, a hierarchical merging stage compresses this pre-filtered set, effectively summarizing semantic content without the noise-induced feature dilution seen in single-stage methods. Extensive experiments on 29 VDR datasets demonstrate that our framework consistently outperforms existing methods, significantly extending the near-lossless compression range and providing robust performance at high compression ratios.
format Preprint
id arxiv_https___arxiv_org_abs_2602_19549
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
Yan, Yibo
Ou, Mingdong
Cao, Yi
Zou, Xin
Huo, Jiahao
Liu, Shuliang
Kwok, James
Hu, Xuming
Computation and Language
Computer Vision and Pattern Recognition
Information Retrieval
Visual Document Retrieval (VDR), which aims to retrieve relevant pages within vast corpora of visually-rich documents, is of significance in current multimodal retrieval applications. The state-of-the-art multi-vector paradigm excels in performance but suffers from prohibitive overhead, a problem that current efficiency methods like pruning and merging address imperfectly, creating a difficult trade-off between compression rate and feature fidelity. To overcome this dilemma, we introduce Prune-then-Merge, a novel two-stage framework that synergizes these complementary approaches. Our method first employs an adaptive pruning stage to filter out low-information patches, creating a refined, high-signal set of embeddings. Subsequently, a hierarchical merging stage compresses this pre-filtered set, effectively summarizing semantic content without the noise-induced feature dilution seen in single-stage methods. Extensive experiments on 29 VDR datasets demonstrate that our framework consistently outperforms existing methods, significantly extending the near-lossless compression range and providing robust performance at high compression ratios.
title Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
topic Computation and Language
Computer Vision and Pattern Recognition
Information Retrieval
url https://arxiv.org/abs/2602.19549