ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yang, Tianyu, He, Chenwei, Hao, Xiangzhao, Wang, Tianyue, Guo, Jiarui, Guo, Haiyun, Qu, Leigang, Wang, Jinqiao, Chua, Tat-Seng
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914435133603840
author Yang, Tianyu
He, Chenwei
Hao, Xiangzhao
Wang, Tianyue
Guo, Jiarui
Guo, Haiyun
Qu, Leigang
Wang, Jinqiao
Chua, Tat-Seng
author_facet Yang, Tianyu
He, Chenwei
Hao, Xiangzhao
Wang, Tianyue
Guo, Jiarui
Guo, Haiyun
Qu, Leigang
Wang, Jinqiao
Chua, Tat-Seng
contents Composed Image Retrieval (CIR) aims to retrieve target images based on a hybrid query comprising a reference image and a modification text. Early dual-tower Vision-Language Models (VLMs) struggle with cross-modality compositional reasoning required for this task. While adapting generative Multimodal Large Language Models (MLLMs) for retrieval offers a promising direction, we identify that this strategy overlooks a fundamental issue: compressing a generative MLLM into a single-embedding discriminative retriever triggers a paradigm conflict, which leads to Capability Degradation - the deterioration of native fine-grained reasoning after retrieval adaptation. To address this challenge, we propose ReCALL, a model-agnostic framework that follows a diagnose-generate-refine pipeline: First, we diagnose cognitive blind spots of the retriever via self-guided informative instance mining. Next, we generate corrective instructions and triplets by prompting the foundation MLLM and conduct quality control with VQA-based consistency filtering. Finally, we refine the retriever through continual training on these triplets with a grouped contrastive scheme, thereby internalizing fine-grained visual-semantic distinctions and realigning the discriminative embedding space of retriever with intrinsic compositional reasoning within the MLLM. Extensive experiments on CIRR and FashionIQ show that ReCALL consistently recalibrates degraded capabilities and achieves state-of-the-art performance. Code is available at https://github.com/RemRico/Recall.
format Preprint
id arxiv_https___arxiv_org_abs_2602_01639
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval
Yang, Tianyu
He, Chenwei
Hao, Xiangzhao
Wang, Tianyue
Guo, Jiarui
Guo, Haiyun
Qu, Leigang
Wang, Jinqiao
Chua, Tat-Seng
Computer Vision and Pattern Recognition
Composed Image Retrieval (CIR) aims to retrieve target images based on a hybrid query comprising a reference image and a modification text. Early dual-tower Vision-Language Models (VLMs) struggle with cross-modality compositional reasoning required for this task. While adapting generative Multimodal Large Language Models (MLLMs) for retrieval offers a promising direction, we identify that this strategy overlooks a fundamental issue: compressing a generative MLLM into a single-embedding discriminative retriever triggers a paradigm conflict, which leads to Capability Degradation - the deterioration of native fine-grained reasoning after retrieval adaptation. To address this challenge, we propose ReCALL, a model-agnostic framework that follows a diagnose-generate-refine pipeline: First, we diagnose cognitive blind spots of the retriever via self-guided informative instance mining. Next, we generate corrective instructions and triplets by prompting the foundation MLLM and conduct quality control with VQA-based consistency filtering. Finally, we refine the retriever through continual training on these triplets with a grouped contrastive scheme, thereby internalizing fine-grained visual-semantic distinctions and realigning the discriminative embedding space of retriever with intrinsic compositional reasoning within the MLLM. Extensive experiments on CIRR and FashionIQ show that ReCALL consistently recalibrates degraded capabilities and achieves state-of-the-art performance. Code is available at https://github.com/RemRico/Recall.
title ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2602.01639