Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Xuan, Li, Kangle, Huang, Haohang, Meng, Rui, Zeng, Wenjun, Shen, Xiaoyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval
di: Lu, Xuan, et al.
Pubblicazione: (2025)
di: Lu, Xuan, et al.
Pubblicazione: (2025)
Rethinking Reasoning in Document Ranking: Why Chain-of-Thought Falls Short
di: Lu, Xuan, et al.
Pubblicazione: (2025)
di: Lu, Xuan, et al.
Pubblicazione: (2025)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
di: Ghosh, Arijit, et al.
Pubblicazione: (2026)
di: Ghosh, Arijit, et al.
Pubblicazione: (2026)
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
di: Lu, Xin, et al.
Pubblicazione: (2023)
di: Lu, Xin, et al.
Pubblicazione: (2023)
MultiConIR: Towards multi-condition Information Retrieval
di: Lu, Xuan, et al.
Pubblicazione: (2025)
di: Lu, Xuan, et al.
Pubblicazione: (2025)
PHPQ: Pyramid Hybrid Pooling Quantization for Efficient Fine-Grained Image Retrieval
di: Zeng, Ziyun, et al.
Pubblicazione: (2021)
di: Zeng, Ziyun, et al.
Pubblicazione: (2021)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
di: Sun, Xinyu, et al.
Pubblicazione: (2026)
di: Sun, Xinyu, et al.
Pubblicazione: (2026)
MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval
di: Nguyen, Tien-Huy, et al.
Pubblicazione: (2026)
di: Nguyen, Tien-Huy, et al.
Pubblicazione: (2026)
Attribute-Guided Multi-Level Attention Network for Fine-Grained Fashion Retrieval
di: Xiao, Ling, et al.
Pubblicazione: (2022)
di: Xiao, Ling, et al.
Pubblicazione: (2022)
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
di: Deng, Chenlong, et al.
Pubblicazione: (2026)
di: Deng, Chenlong, et al.
Pubblicazione: (2026)
MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
di: Song, Tingyu, et al.
Pubblicazione: (2026)
di: Song, Tingyu, et al.
Pubblicazione: (2026)
Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
Global-to-Local or Local-to-Global? Enhancing Image Retrieval with Efficient Local Search and Effective Global Re-ranking
di: Aiger, Dror, et al.
Pubblicazione: (2025)
di: Aiger, Dror, et al.
Pubblicazione: (2025)
Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
Composed Multi-modal Retrieval: A Survey of Approaches and Applications
di: Zhang, Kun, et al.
Pubblicazione: (2025)
di: Zhang, Kun, et al.
Pubblicazione: (2025)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
di: Huang, Jinghao, et al.
Pubblicazione: (2025)
di: Huang, Jinghao, et al.
Pubblicazione: (2025)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
di: Sun, Zelong, et al.
Pubblicazione: (2025)
di: Sun, Zelong, et al.
Pubblicazione: (2025)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment
di: Mounis, Mohamed Darwish, et al.
Pubblicazione: (2026)
di: Mounis, Mohamed Darwish, et al.
Pubblicazione: (2026)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild
di: Wei, Tianqi, et al.
Pubblicazione: (2024)
di: Wei, Tianqi, et al.
Pubblicazione: (2024)
Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
Event-aware Video Corpus Moment Retrieval
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction
di: Zhang, Yao, et al.
Pubblicazione: (2026)
di: Zhang, Yao, et al.
Pubblicazione: (2026)
A Survey of Multimodal Composite Editing and Retrieval
di: Li, Suyan, et al.
Pubblicazione: (2024)
di: Li, Suyan, et al.
Pubblicazione: (2024)
MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
di: Huang, Haohang, et al.
Pubblicazione: (2026)
di: Huang, Haohang, et al.
Pubblicazione: (2026)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
di: Li, Po-han, et al.
Pubblicazione: (2024)
di: Li, Po-han, et al.
Pubblicazione: (2024)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
di: Sun, Zengbao, et al.
Pubblicazione: (2024)
di: Sun, Zengbao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval
di: Lu, Xuan, et al.
Pubblicazione: (2025) -
Rethinking Reasoning in Document Ranking: Why Chain-of-Thought Falls Short
di: Lu, Xuan, et al.
Pubblicazione: (2025) -
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
di: Xu, Yifan, et al.
Pubblicazione: (2024) -
RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?
di: Ghosh, Arijit, et al.
Pubblicazione: (2026) -
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
di: Lu, Xin, et al.
Pubblicazione: (2023)