See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Junjie, Tang, Yunhan, Wang, Yijie, Yuan, Zhihao, Wang, Huan, He, Yangfan, Li, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
par: Wen, Zhihao, et autres
Publié: (2025)
par: Wen, Zhihao, et autres
Publié: (2025)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
par: Mao, Xianwei, et autres
Publié: (2026)
par: Mao, Xianwei, et autres
Publié: (2026)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
par: Chen, Zhuohong, et autres
Publié: (2026)
par: Chen, Zhuohong, et autres
Publié: (2026)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
par: Zhu, Yingjian, et autres
Publié: (2026)
par: Zhu, Yingjian, et autres
Publié: (2026)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
par: Lee, Dosung, et autres
Publié: (2025)
par: Lee, Dosung, et autres
Publié: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
par: Wang, Zeqing, et autres
Publié: (2023)
par: Wang, Zeqing, et autres
Publié: (2023)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
par: Fernando, Basura, et autres
Publié: (2025)
par: Fernando, Basura, et autres
Publié: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
par: Cheng, Yu, et autres
Publié: (2025)
par: Cheng, Yu, et autres
Publié: (2025)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
par: Tran, Duong T., et autres
Publié: (2025)
par: Tran, Duong T., et autres
Publié: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024)
par: Barezi, Elham J., et autres
Publié: (2024)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
par: Hong, Yuyang, et autres
Publié: (2026)
par: Hong, Yuyang, et autres
Publié: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
par: Choi, Changin, et autres
Publié: (2025)
par: Choi, Changin, et autres
Publié: (2025)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
par: Tao, Qian, et autres
Publié: (2025)
par: Tao, Qian, et autres
Publié: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
par: Zhang, Zhengxuan, et autres
Publié: (2025)
par: Zhang, Zhengxuan, et autres
Publié: (2025)
Object Retrieval for Visual Question Answering with Outside Knowledge
par: Kan, Shichao, et autres
Publié: (2024)
par: Kan, Shichao, et autres
Publié: (2024)
A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering
par: Liu, Zhiyue, et autres
Publié: (2025)
par: Liu, Zhiyue, et autres
Publié: (2025)
Reconstruction as a Bridge for Event-Based Visual Question Answering
par: Lou, Hanyue, et autres
Publié: (2025)
par: Lou, Hanyue, et autres
Publié: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
par: Xi, Suyang, et autres
Publié: (2026)
par: Xi, Suyang, et autres
Publié: (2026)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
par: Xue, Junxiao, et autres
Publié: (2024)
par: Xue, Junxiao, et autres
Publié: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
par: Peng, Daowan, et autres
Publié: (2025)
par: Peng, Daowan, et autres
Publié: (2025)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
par: Weng, Weixi, et autres
Publié: (2024)
par: Weng, Weixi, et autres
Publié: (2024)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
par: Liu, Yexin, et autres
Publié: (2024)
par: Liu, Yexin, et autres
Publié: (2024)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
par: Lassoued, Aymen, et autres
Publié: (2026)
par: Lassoued, Aymen, et autres
Publié: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
par: Lim, Su Hyeon, et autres
Publié: (2024)
par: Lim, Su Hyeon, et autres
Publié: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
par: Gou, Chenhui, et autres
Publié: (2025)
par: Gou, Chenhui, et autres
Publié: (2025)
Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
par: Peng, Jingwei, et autres
Publié: (2025)
par: Peng, Jingwei, et autres
Publié: (2025)
GoT-CQA: Graph-of-Thought Guided Compositional Reasoning for Chart Question Answering
par: Zhang, Lingling, et autres
Publié: (2024)
par: Zhang, Lingling, et autres
Publié: (2024)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
par: Moradi, Mohammad Mahdi, et autres
Publié: (2025)
par: Moradi, Mohammad Mahdi, et autres
Publié: (2025)
Improving Data Augmentation for Robust Visual Question Answering with Effective Curriculum Learning
par: Zheng, Yuhang, et autres
Publié: (2024)
par: Zheng, Yuhang, et autres
Publié: (2024)
Documents similaires
-
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
par: Wen, Zhihao, et autres
Publié: (2025) -
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025) -
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024) -
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
par: Mao, Xianwei, et autres
Publié: (2026) -
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
par: Chen, Zhuohong, et autres
Publié: (2026)