Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhengxuan, Wu, Yin, Luo, Yuyu, Tang, Nan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024)
di: Wu, Yifan, et al.
Pubblicazione: (2024)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
di: Wen, Zhihao, et al.
Pubblicazione: (2025)
di: Wen, Zhihao, et al.
Pubblicazione: (2025)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)
di: An, Jianing, et al.
Pubblicazione: (2025)
ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering
di: Liu, Zhiyue, et al.
Pubblicazione: (2025)
di: Liu, Zhiyue, et al.
Pubblicazione: (2025)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
di: Ahir, Param, et al.
Pubblicazione: (2023)
di: Ahir, Param, et al.
Pubblicazione: (2023)
Path-RAG: Knowledge-Guided Key Region Retrieval for Open-ended Pathology Visual Question Answering
di: Naeem, Awais, et al.
Pubblicazione: (2024)
di: Naeem, Awais, et al.
Pubblicazione: (2024)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
IIU: Independent Inference Units for Knowledge-based Visual Question Answering
di: Li, Yili, et al.
Pubblicazione: (2024)
di: Li, Yili, et al.
Pubblicazione: (2024)
Saliency Guided Longitudinal Medical Visual Question Answering
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
di: Hong, Yuyang, et al.
Pubblicazione: (2025)
di: Hong, Yuyang, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
AskChart: Universal Chart Understanding through Textual Enhancement
di: Yang, Xudong, et al.
Pubblicazione: (2024)
di: Yang, Xudong, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)
di: Li, Peize, et al.
Pubblicazione: (2023)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
di: Shbita, Basel, et al.
Pubblicazione: (2026)
di: Shbita, Basel, et al.
Pubblicazione: (2026)
Sketch and Text Synergy: Fusing Structural Contours and Descriptive Attributes for Fine-Grained Image Retrieval
di: Wang, Siyuan, et al.
Pubblicazione: (2026)
di: Wang, Siyuan, et al.
Pubblicazione: (2026)
FG-CLIP: Fine-Grained Visual and Textual Alignment
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
di: Hagen, Luca, et al.
Pubblicazione: (2026)
di: Hagen, Luca, et al.
Pubblicazione: (2026)
Free Form Medical Visual Question Answering in Radiology
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
di: Özdemir, Övgü, et al.
Pubblicazione: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
di: Rajkhowa, Tonmoy, et al.
Pubblicazione: (2024)
di: Rajkhowa, Tonmoy, et al.
Pubblicazione: (2024)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
di: Liu, Ying, et al.
Pubblicazione: (2024)
di: Liu, Ying, et al.
Pubblicazione: (2024)
Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering
di: Marouf, Imad Eddine, et al.
Pubblicazione: (2025)
di: Marouf, Imad Eddine, et al.
Pubblicazione: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
di: Xi, Suyang, et al.
Pubblicazione: (2026)
di: Xi, Suyang, et al.
Pubblicazione: (2026)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
di: Wieczorek, Tobias Jan, et al.
Pubblicazione: (2025)
Location-Aware Pretraining for Medical Difference Visual Question Answering
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
di: Musinguzi, Denis, et al.
Pubblicazione: (2026)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
Powerful Teachers Matter: Text-Guided Multi-view Knowledge Distillation with Visual Prior Enhancement
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering
di: Li, Zhifei, et al.
Pubblicazione: (2025)
di: Li, Zhifei, et al.
Pubblicazione: (2025)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024) -
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025) -
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
di: Wen, Zhihao, et al.
Pubblicazione: (2025) -
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
di: Mao, Xianwei, et al.
Pubblicazione: (2026) -
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)