MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kai, Luan, Yi, Hu, Hexiang, Lee, Kenton, Qiao, Siyuan, Chen, Wenhu, Su, Yu, Chang, Ming-Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
par: Tran, Quang-Linh, et autres
Publié: (2025)
par: Tran, Quang-Linh, et autres
Publié: (2025)
InfoCIR: Multimedia Analysis for Composed Image Retrieval
par: Dravilas, Ioannis, et autres
Publié: (2026)
par: Dravilas, Ioannis, et autres
Publié: (2026)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
par: Li, Haoxuan, et autres
Publié: (2025)
par: Li, Haoxuan, et autres
Publié: (2025)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Efficient Self-Supervised Video Hashing with Selective State Spaces
par: Wang, Jinpeng, et autres
Publié: (2024)
par: Wang, Jinpeng, et autres
Publié: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Self-distilled Dynamic Fusion Network for Language-based Fashion Retrieval
par: Wu, Yiming, et autres
Publié: (2024)
par: Wu, Yiming, et autres
Publié: (2024)
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
par: Lian, Niu, et autres
Publié: (2025)
par: Lian, Niu, et autres
Publié: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval
par: Ning, Hailong, et autres
Publié: (2025)
par: Ning, Hailong, et autres
Publié: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
From Swath to Full-Disc: Advancing Precipitation Retrieval with Multimodal Knowledge Expansion
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
Multimodal Information Retrieval for Open World with Edit Distance Weak Supervision
par: Solaiman, KMA, et autres
Publié: (2025)
par: Solaiman, KMA, et autres
Publié: (2025)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
par: Yang, Jheng-Hong, et autres
Publié: (2024)
par: Yang, Jheng-Hong, et autres
Publié: (2024)
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
par: Su, Taoyu, et autres
Publié: (2025)
par: Su, Taoyu, et autres
Publié: (2025)
A Comprehensive Survey on Composed Image Retrieval
par: Song, Xuemeng, et autres
Publié: (2025)
par: Song, Xuemeng, et autres
Publié: (2025)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
Multimodal Learned Sparse Retrieval for Image Suggestion
par: Nguyen, Thong, et autres
Publié: (2024)
par: Nguyen, Thong, et autres
Publié: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
par: Wu, Qiyu, et autres
Publié: (2025)
par: Wu, Qiyu, et autres
Publié: (2025)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
par: Li, Po-han, et autres
Publié: (2024)
par: Li, Po-han, et autres
Publié: (2024)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
par: Shih, Yu-Fei, et autres
Publié: (2025)
par: Shih, Yu-Fei, et autres
Publié: (2025)
Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge
par: Hu, Congcong, et autres
Publié: (2026)
par: Hu, Congcong, et autres
Publié: (2026)
RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents
par: Jin, Jiarui, et autres
Publié: (2026)
par: Jin, Jiarui, et autres
Publié: (2026)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024)
par: Tahmasebi, Sahar, et autres
Publié: (2024)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Why Multi-Interest Fairness Matters: Hypergraph Contrastive Multi-Interest Learning for Fair Conversational Recommender System
par: Zheng, Yongsen, et autres
Publié: (2025)
par: Zheng, Yongsen, et autres
Publié: (2025)
Verifying Cross-modal Entity Consistency in News using Vision-language Models
par: Tahmasebi, Sahar, et autres
Publié: (2025)
par: Tahmasebi, Sahar, et autres
Publié: (2025)
Documents similaires
-
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
par: Tran, Quang-Linh, et autres
Publié: (2025) -
InfoCIR: Multimedia Analysis for Composed Image Retrieval
par: Dravilas, Ioannis, et autres
Publié: (2026) -
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
par: Li, Haoxuan, et autres
Publié: (2025) -
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024) -
Efficient Self-Supervised Video Hashing with Selective State Spaces
par: Wang, Jinpeng, et autres
Publié: (2024)