Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Daowan, Wei, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
di: Yu, Zhou, et al.
Pubblicazione: (2023)
di: Yu, Zhou, et al.
Pubblicazione: (2023)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
di: Cho, Yeongjae, et al.
Pubblicazione: (2024)
di: Cho, Yeongjae, et al.
Pubblicazione: (2024)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
di: Gupta, Akash, et al.
Pubblicazione: (2025)
di: Gupta, Akash, et al.
Pubblicazione: (2025)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
di: Kim, Taehee, et al.
Pubblicazione: (2024)
di: Kim, Taehee, et al.
Pubblicazione: (2024)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
di: Loem, Mengsay, et al.
Pubblicazione: (2025)
di: Loem, Mengsay, et al.
Pubblicazione: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
di: Ahmed, Rafid, et al.
Pubblicazione: (2026)
di: Ahmed, Rafid, et al.
Pubblicazione: (2026)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
di: Barua, Deeparghya Dutta, et al.
Pubblicazione: (2024)
di: Barua, Deeparghya Dutta, et al.
Pubblicazione: (2024)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering
di: Thai, Triet Minh, et al.
Pubblicazione: (2023)
di: Thai, Triet Minh, et al.
Pubblicazione: (2023)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024) -
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024) -
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024) -
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026) -
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)