Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
Fuente:
arXiv
Salvato in:
| Autori principali: | Raja, Rahul, Vats, Arpita |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024)
di: Dong, Junnan, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
di: Si, Jacob, et al.
Pubblicazione: (2025)
di: Si, Jacob, et al.
Pubblicazione: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval
di: Du, Yang, et al.
Pubblicazione: (2024)
di: Du, Yang, et al.
Pubblicazione: (2024)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
di: Alomari, Hani, et al.
Pubblicazione: (2025)
di: Alomari, Hani, et al.
Pubblicazione: (2025)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation
di: Ghosh, Rahul, et al.
Pubblicazione: (2025)
di: Ghosh, Rahul, et al.
Pubblicazione: (2025)
It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap
di: Fahim, Abrar, et al.
Pubblicazione: (2024)
di: Fahim, Abrar, et al.
Pubblicazione: (2024)
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
di: Sarwar, Nobin
Pubblicazione: (2025)
di: Sarwar, Nobin
Pubblicazione: (2025)
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models
di: Wang, Yimu, et al.
Pubblicazione: (2024)
di: Wang, Yimu, et al.
Pubblicazione: (2024)
Closing the Modality Gap for Mixed Modality Search
di: Li, Binxu, et al.
Pubblicazione: (2025)
di: Li, Binxu, et al.
Pubblicazione: (2025)
Efficient and High-Fidelity Omni Modality Retrieval
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Modality-Balanced Learning for Multimedia Recommendation
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
Retrieval-augmented Prompt Learning for Pre-trained Foundation Models
di: Chen, Xiang, et al.
Pubblicazione: (2025)
di: Chen, Xiang, et al.
Pubblicazione: (2025)
VideoRAG: Retrieval-Augmented Generation over Video Corpus
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
Benchmarking Robustness of Contrastive Learning Models for Medical Image-Report Retrieval
di: Deanda, Demetrio, et al.
Pubblicazione: (2025)
di: Deanda, Demetrio, et al.
Pubblicazione: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
RAMQA: A Unified Framework for Retrieval-Augmented Multi-Modal Question Answering
di: Bai, Yang, et al.
Pubblicazione: (2025)
di: Bai, Yang, et al.
Pubblicazione: (2025)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
VLM-KG: Multimodal Radiology Knowledge Graph Generation
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
Using Knowledge Graphs to harvest datasets for efficient CLIP model training
di: Ging, Simon, et al.
Pubblicazione: (2025)
di: Ging, Simon, et al.
Pubblicazione: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
Enhancing Question Answering Precision with Optimized Vector Retrieval and Instructions
di: Yang, Lixiao, et al.
Pubblicazione: (2024)
di: Yang, Lixiao, et al.
Pubblicazione: (2024)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
Reasoning-Augmented Representations for Multimodal Retrieval
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
di: Messina, Nicola, et al.
Pubblicazione: (2024)
di: Messina, Nicola, et al.
Pubblicazione: (2024)
PAPERCLIP: Associating Astronomical Observations and Natural Language with Multi-Modal Models
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
di: Mishra-Sharma, Siddharth, et al.
Pubblicazione: (2024)
PC$^2$: Pseudo-Classification Based Pseudo-Captioning for Noisy Correspondence Learning in Cross-Modal Retrieval
di: Duan, Yue, et al.
Pubblicazione: (2024)
di: Duan, Yue, et al.
Pubblicazione: (2024)
Evidential Transformers for Improved Image Retrieval
di: Dordevic, Danilo, et al.
Pubblicazione: (2024)
di: Dordevic, Danilo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024) -
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024) -
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024) -
TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
di: Si, Jacob, et al.
Pubblicazione: (2025) -
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)