SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Jielin, Madotto, Andrea, Lin, Zhaojiang, Crook, Paul A., Xu, Yifan Ethan, Dong, Xin Luna, Faloutsos, Christos, Li, Lei, Damavandi, Babak, Moon, Seungwhan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
par: Imani, Shima, et autres
Publié: (2025)
par: Imani, Shima, et autres
Publié: (2025)
TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
par: Imani, Shima, et autres
Publié: (2025)
par: Imani, Shima, et autres
Publié: (2025)
Entity Retrieval for Answering Entity-Centric Questions
par: Shavarani, Hassan S., et autres
Publié: (2024)
par: Shavarani, Hassan S., et autres
Publié: (2024)
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
par: Imani, Shima, et autres
Publié: (2025)
par: Imani, Shima, et autres
Publié: (2025)
Evaluating Durability: Benchmark Insights into Multimodal Watermarking
par: Qiu, Jielin, et autres
Publié: (2024)
par: Qiu, Jielin, et autres
Publié: (2024)
KERAG: Knowledge-Enhanced Retrieval-Augmented Generation for Advanced Question Answering
par: Sun, Yushi, et autres
Publié: (2025)
par: Sun, Yushi, et autres
Publié: (2025)
Continual Dialogue State Tracking via Example-Guided Question Answering
par: Cho, Hyundong, et autres
Publié: (2023)
par: Cho, Hyundong, et autres
Publié: (2023)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
par: Kim, Jeonghwan, et autres
Publié: (2026)
par: Kim, Jeonghwan, et autres
Publié: (2026)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
par: Qiu, Jielin, et autres
Publié: (2024)
par: Qiu, Jielin, et autres
Publié: (2024)
Doppelgänger's Watch: A Split Objective Approach to Large Language Models
par: Ghasemlou, Shervin, et autres
Publié: (2024)
par: Ghasemlou, Shervin, et autres
Publié: (2024)
Large Language Models as Zero-shot Dialogue State Tracker through Function Calling
par: Li, Zekun, et autres
Publié: (2024)
par: Li, Zekun, et autres
Publié: (2024)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering
par: Chen, Xupeng, et autres
Publié: (2026)
par: Chen, Xupeng, et autres
Publié: (2026)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
MDER-DR: Multi-Hop Question Answering with Entity-Centric Summaries
par: Campi, Riccardo, et autres
Publié: (2026)
par: Campi, Riccardo, et autres
Publié: (2026)
VisualLens: Personalization through Task-Agnostic Visual History
par: Zhu, Wang Bill, et autres
Publié: (2024)
par: Zhu, Wang Bill, et autres
Publié: (2024)
SRAG: Structured Retrieval-Augmented Generation for Multi-Entity Question Answering over Wikipedia Graph
par: Lin, Teng, et autres
Publié: (2025)
par: Lin, Teng, et autres
Publié: (2025)
PDF Retrieval Augmented Question Answering
par: Hoang, Thi Thu Uyen, et autres
Publié: (2025)
par: Hoang, Thi Thu Uyen, et autres
Publié: (2025)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
par: Lim, Su Hyeon, et autres
Publié: (2024)
par: Lim, Su Hyeon, et autres
Publié: (2024)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
par: Wu, Hui, et autres
Publié: (2026)
par: Wu, Hui, et autres
Publié: (2026)
ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering
par: Kwon, Daeyong, et autres
Publié: (2025)
par: Kwon, Daeyong, et autres
Publié: (2025)
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios
par: Chang, Eun, et autres
Publié: (2025)
par: Chang, Eun, et autres
Publié: (2025)
Uncertainty Quantification in Retrieval Augmented Question Answering
par: Perez-Beltrachini, Laura, et autres
Publié: (2025)
par: Perez-Beltrachini, Laura, et autres
Publié: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics
par: Xi, Yueqing, et autres
Publié: (2025)
par: Xi, Yueqing, et autres
Publié: (2025)
BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering
par: Chen, Jinghong, et autres
Publié: (2026)
par: Chen, Jinghong, et autres
Publié: (2026)
An Entity Linking Agent for Question Answering
par: Luo, Yajie, et autres
Publié: (2025)
par: Luo, Yajie, et autres
Publié: (2025)
Understanding Retrieval Augmentation for Long-Form Question Answering
par: Chen, Hung-Ting, et autres
Publié: (2023)
par: Chen, Hung-Ting, et autres
Publié: (2023)
Answerability in Retrieval-Augmented Open-Domain Question Answering
par: Abdumalikov, Rustam, et autres
Publié: (2024)
par: Abdumalikov, Rustam, et autres
Publié: (2024)
Retrieval Augmented Generation for Domain-specific Question Answering
par: Sharma, Sanat, et autres
Publié: (2024)
par: Sharma, Sanat, et autres
Publié: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
par: Shaaban, Mai A., et autres
Publié: (2025)
par: Shaaban, Mai A., et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
TouchUp-G: Improving Feature Representation through Graph-Centric Finetuning
par: Zhu, Jing, et autres
Publié: (2023)
par: Zhu, Jing, et autres
Publié: (2023)
Multimodal Rationales for Explainable Visual Question Answering
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
Multimodal Multihop Source Retrieval for Web Question Answering
par: Yarrabelly, Navya, et autres
Publié: (2025)
par: Yarrabelly, Navya, et autres
Publié: (2025)
Memory-Centric Embodied Question Answering
par: Zhai, Mingliang, et autres
Publié: (2025)
par: Zhai, Mingliang, et autres
Publié: (2025)
Documents similaires
-
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
par: Zhang, Yichi, et autres
Publié: (2025) -
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
par: Imani, Shima, et autres
Publié: (2025) -
TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
par: Imani, Shima, et autres
Publié: (2025) -
Entity Retrieval for Answering Entity-Centric Questions
par: Shavarani, Hassan S., et autres
Publié: (2024) -
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
par: Imani, Shima, et autres
Publié: (2025)