Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Jiaqi, Shi, Kaize, Wu, Zonghan, Huo, Huan, Wang, Dingxian, Xu, Guandong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
par: Tran, Quang-Linh, et autres
Publié: (2025)
par: Tran, Quang-Linh, et autres
Publié: (2025)
From Swath to Full-Disc: Advancing Precipitation Retrieval with Multimodal Knowledge Expansion
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning
par: Gong, Ziyu, et autres
Publié: (2025)
par: Gong, Ziyu, et autres
Publié: (2025)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering
par: Koh, Junyoung, et autres
Publié: (2026)
par: Koh, Junyoung, et autres
Publié: (2026)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
CM$^3$: Calibrating Multimodal Recommendation
par: Zhou, Xin, et autres
Publié: (2025)
par: Zhou, Xin, et autres
Publié: (2025)
Self-distilled Dynamic Fusion Network for Language-based Fashion Retrieval
par: Wu, Yiming, et autres
Publié: (2024)
par: Wu, Yiming, et autres
Publié: (2024)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
From ID-based to ID-free: Rethinking ID Effectiveness in Multimodal Collaborative Filtering Recommendation
par: Li, Guohao, et autres
Publié: (2025)
par: Li, Guohao, et autres
Publié: (2025)
Performance Evaluation in Multimedia Retrieval
par: Sauter, Loris, et autres
Publié: (2024)
par: Sauter, Loris, et autres
Publié: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval
par: Zou, Qiang, et autres
Publié: (2025)
par: Zou, Qiang, et autres
Publié: (2025)
VCR: Video representation for Contextual Retrieval
par: Nir, Oron, et autres
Publié: (2024)
par: Nir, Oron, et autres
Publié: (2024)
Multimodal Learned Sparse Retrieval for Image Suggestion
par: Nguyen, Thong, et autres
Publié: (2024)
par: Nguyen, Thong, et autres
Publié: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
par: Li, Po-han, et autres
Publié: (2024)
par: Li, Po-han, et autres
Publié: (2024)
Breaking the Curse of Knowledge: Towards Effective Multimodal Recommendation using Knowledge Soft Integration
par: Ouyang, Kai, et autres
Publié: (2023)
par: Ouyang, Kai, et autres
Publié: (2023)
Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval
par: Ning, Hailong, et autres
Publié: (2025)
par: Ning, Hailong, et autres
Publié: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
par: Wang, Tianshi, et autres
Publié: (2023)
par: Wang, Tianshi, et autres
Publié: (2023)
Knowledge-aware Diffusion-Enhanced Multimedia Recommendation
par: Mo, Xian, et autres
Publié: (2025)
par: Mo, Xian, et autres
Publié: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
par: Yang, Jheng-Hong, et autres
Publié: (2024)
par: Yang, Jheng-Hong, et autres
Publié: (2024)
MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
U-Sticker: A Large-Scale Multi-Domain User Sticker Dataset for Retrieval and Personalization
par: Chee, Heng Er Metilda, et autres
Publié: (2025)
par: Chee, Heng Er Metilda, et autres
Publié: (2025)
The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval
par: Fu, Junchen, et autres
Publié: (2026)
par: Fu, Junchen, et autres
Publié: (2026)
The State-of-the-Art in Lifelog Retrieval: A Review of Progress at the ACM Lifelog Search Challenge Workshop 2022-24
par: Tran, Allie, et autres
Publié: (2025)
par: Tran, Allie, et autres
Publié: (2025)
A Comprehensive Survey on Composed Image Retrieval
par: Song, Xuemeng, et autres
Publié: (2025)
par: Song, Xuemeng, et autres
Publié: (2025)
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
par: Jia, Yanhao, et autres
Publié: (2025)
par: Jia, Yanhao, et autres
Publié: (2025)
StePO-Rec: Towards Personalized Outfit Styling Assistant via Knowledge-Guided Multi-Step Reasoning
par: Bi, Yuxi, et autres
Publié: (2025)
par: Bi, Yuxi, et autres
Publié: (2025)
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
par: Wu, Jiaxin, et autres
Publié: (2025)
par: Wu, Jiaxin, et autres
Publié: (2025)
Documents similaires
-
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025) -
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025) -
RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation
par: Tourani, Ali, et autres
Publié: (2025) -
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
par: Tran, Quang-Linh, et autres
Publié: (2025) -
From Swath to Full-Disc: Advancing Precipitation Retrieval with Multimodal Knowledge Expansion
par: Wang, Zheng, et autres
Publié: (2025)