Visual Product Search Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Govindappa, Karthik Sulthanpete |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
par: Deng, Chenlong, et autres
Publié: (2026)
par: Deng, Chenlong, et autres
Publié: (2026)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
par: Hou, Bohan, et autres
Publié: (2026)
par: Hou, Bohan, et autres
Publié: (2026)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
par: Yu, Rongyi, et autres
Publié: (2026)
par: Yu, Rongyi, et autres
Publié: (2026)
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
par: Gong, Jiaying, et autres
Publié: (2025)
par: Gong, Jiaying, et autres
Publié: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
par: Fu, Junchen, et autres
Publié: (2026)
par: Fu, Junchen, et autres
Publié: (2026)
A Flexible and Scalable Framework for Video Moment Search
par: Zhang, Chongzhi, et autres
Publié: (2025)
par: Zhang, Chongzhi, et autres
Publié: (2025)
Interactive Mars Image Content-Based Search with Interpretable Machine Learning
par: Vasu, Bhavan, et autres
Publié: (2024)
par: Vasu, Bhavan, et autres
Publié: (2024)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search
par: Tang, Hengzhu, et autres
Publié: (2025)
par: Tang, Hengzhu, et autres
Publié: (2025)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
par: Cai, Qifeng, et autres
Publié: (2025)
par: Cai, Qifeng, et autres
Publié: (2025)
Advancing Re-Ranking with Multimodal Fusion and Target-Oriented Auxiliary Tasks in E-Commerce Search
par: Xu, Enqiang, et autres
Publié: (2024)
par: Xu, Enqiang, et autres
Publié: (2024)
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
par: Wasserman, Navve, et autres
Publié: (2025)
par: Wasserman, Navve, et autres
Publié: (2025)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
par: Xu, Mingjun, et autres
Publié: (2025)
par: Xu, Mingjun, et autres
Publié: (2025)
Global-to-Local or Local-to-Global? Enhancing Image Retrieval with Efficient Local Search and Effective Global Re-ranking
par: Aiger, Dror, et autres
Publié: (2025)
par: Aiger, Dror, et autres
Publié: (2025)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
par: Molina, Adrià, et autres
Publié: (2024)
par: Molina, Adrià, et autres
Publié: (2024)
ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
par: Shi, Zhuofan, et autres
Publié: (2026)
par: Shi, Zhuofan, et autres
Publié: (2026)
Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation
par: Cheng, Zehua, et autres
Publié: (2026)
par: Cheng, Zehua, et autres
Publié: (2026)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
par: Xiao, Bin, et autres
Publié: (2023)
par: Xiao, Bin, et autres
Publié: (2023)
LookSync: Large-Scale Visual Product Search System for AI-Generated Fashion Looks
par: M, Pradeep, et autres
Publié: (2025)
par: M, Pradeep, et autres
Publié: (2025)
ProGEO: Generating Prompts through Image-Text Contrastive Learning for Visual Geo-localization
par: Mao, Chen, et autres
Publié: (2024)
par: Mao, Chen, et autres
Publié: (2024)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
par: Meng, GuangHao, et autres
Publié: (2025)
par: Meng, GuangHao, et autres
Publié: (2025)
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
par: Kim, Juyeon, et autres
Publié: (2025)
par: Kim, Juyeon, et autres
Publié: (2025)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding
par: Pal, Aniket, et autres
Publié: (2025)
par: Pal, Aniket, et autres
Publié: (2025)
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search
par: Hu, Fan, et autres
Publié: (2025)
par: Hu, Fan, et autres
Publié: (2025)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
par: Yan, Yibo, et autres
Publié: (2026)
par: Yan, Yibo, et autres
Publié: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
par: Xu, Tao
Publié: (2026)
par: Xu, Tao
Publié: (2026)
WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata
par: Sridhar, Prasanna, et autres
Publié: (2026)
par: Sridhar, Prasanna, et autres
Publié: (2026)
Attention Grounded Enhancement for Visual Document Retrieval
par: Cui, Wanqing, et autres
Publié: (2025)
par: Cui, Wanqing, et autres
Publié: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Personal Visual Memory from Explicit and Implicit Evidence
par: Nguyen, Viet, et autres
Publié: (2026)
par: Nguyen, Viet, et autres
Publié: (2026)
PICS: Pipeline for Image Captioning and Search
par: Rosario, Grant, et autres
Publié: (2024)
par: Rosario, Grant, et autres
Publié: (2024)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
par: Guo, Hao, et autres
Publié: (2025)
par: Guo, Hao, et autres
Publié: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
par: Zhou, Junjie, et autres
Publié: (2024)
par: Zhou, Junjie, et autres
Publié: (2024)
VisTopics: A Visual Semantic Unsupervised Approach to Topic Modeling of Video and Image Data
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
par: Song, Tingyu, et autres
Publié: (2026)
par: Song, Tingyu, et autres
Publié: (2026)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Documents similaires
-
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
par: Deng, Chenlong, et autres
Publié: (2026) -
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
par: Hou, Bohan, et autres
Publié: (2026) -
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
par: Yu, Rongyi, et autres
Publié: (2026) -
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
par: Gong, Jiaying, et autres
Publié: (2025) -
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)