Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA
Fuente:
arXiv
Saved in:
| Main Authors: | Barezi, Elham J., Kordjamshidi, Parisa |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
by: Barezi, Elham J., et al.
Published: (2024)
by: Barezi, Elham J., et al.
Published: (2024)
NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization
by: Kamali, Danial, et al.
Published: (2024)
by: Kamali, Danial, et al.
Published: (2024)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
by: Kamali, Danial, et al.
Published: (2025)
by: Kamali, Danial, et al.
Published: (2025)
Teaching Probabilistic Logical Reasoning to Transformers
by: Nafar, Aliakbar, et al.
Published: (2023)
by: Nafar, Aliakbar, et al.
Published: (2023)
A Survey on Compositional Learning of AI Models: Theoretical and Experimental Practices
by: Sinha, Sania, et al.
Published: (2024)
by: Sinha, Sania, et al.
Published: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
by: Nafar, Aliakbar, et al.
Published: (2024)
by: Nafar, Aliakbar, et al.
Published: (2024)
Exploring Spatial Language Grounding Through Referring Expressions
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law
by: Kordjamshidi, Parisa, et al.
Published: (2026)
by: Kordjamshidi, Parisa, et al.
Published: (2026)
Consistent Joint Decision-Making with Heterogeneous Learning Models
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
Extracting Probabilistic Knowledge from Large Language Models for Bayesian Network Parameterization
by: Nafar, Aliakbar, et al.
Published: (2025)
by: Nafar, Aliakbar, et al.
Published: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
by: Mao, Xianwei, et al.
Published: (2026)
by: Mao, Xianwei, et al.
Published: (2026)
Learning vs Retrieval: The Role of In-Context Examples in Regression with Large Language Models
by: Nafar, Aliakbar, et al.
Published: (2024)
by: Nafar, Aliakbar, et al.
Published: (2024)
Neuro-Symbolic Frameworks: Conceptual Characterization and Empirical Comparative Analysis
by: Sinha, Sania, et al.
Published: (2025)
by: Sinha, Sania, et al.
Published: (2025)
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
by: Shen, Jialu, et al.
Published: (2026)
by: Shen, Jialu, et al.
Published: (2026)
VQA$^2$: Visual Question Answering for Video Quality Assessment
by: Jia, Ziheng, et al.
Published: (2024)
by: Jia, Ziheng, et al.
Published: (2024)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
by: Ma, Tianyi, et al.
Published: (2025)
by: Ma, Tianyi, et al.
Published: (2025)
KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA
by: Yang, Fan, et al.
Published: (2026)
by: Yang, Fan, et al.
Published: (2026)
An Agentic Framework for Neuro-Symbolic Programming
by: Nafar, Aliakbar, et al.
Published: (2026)
by: Nafar, Aliakbar, et al.
Published: (2026)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
by: Vu, Sinh Trong, et al.
Published: (2025)
by: Vu, Sinh Trong, et al.
Published: (2025)
ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
by: Yin, Shaofeng, et al.
Published: (2025)
by: Yin, Shaofeng, et al.
Published: (2025)
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios
by: Chang, Eun, et al.
Published: (2025)
by: Chang, Eun, et al.
Published: (2025)
REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment
by: Ye, Kai, et al.
Published: (2026)
by: Ye, Kai, et al.
Published: (2026)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
by: Chen, Pingyi, et al.
Published: (2024)
by: Chen, Pingyi, et al.
Published: (2024)
VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA
by: Madaka, Madhuri Latha, et al.
Published: (2025)
by: Madaka, Madhuri Latha, et al.
Published: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
by: Zhang, Yue, et al.
Published: (2025)
by: Zhang, Yue, et al.
Published: (2025)
MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
by: Mohammadshirazi, Ahmad, et al.
Published: (2025)
by: Mohammadshirazi, Ahmad, et al.
Published: (2025)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
by: Shrestha, Robik, et al.
Published: (2020)
by: Shrestha, Robik, et al.
Published: (2020)
Knowledge Generation for Zero-shot Knowledge-based VQA
by: Cao, Rui, et al.
Published: (2024)
by: Cao, Rui, et al.
Published: (2024)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
by: Kim, Yoonsik, et al.
Published: (2024)
by: Kim, Yoonsik, et al.
Published: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
by: Min, Juhong, et al.
Published: (2024)
by: Min, Juhong, et al.
Published: (2024)
Prompt2DeModel: Declarative Neuro-Symbolic Modeling with Natural Language
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
by: Compagnoni, Alberto, et al.
Published: (2025)
by: Compagnoni, Alberto, et al.
Published: (2025)
Rationale-guided Prompting for Knowledge-based Visual Question Answering
by: Hu, Zhongjian, et al.
Published: (2024)
by: Hu, Zhongjian, et al.
Published: (2024)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
by: He, Runlong, et al.
Published: (2025)
by: He, Runlong, et al.
Published: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
by: Choi, Changin, et al.
Published: (2025)
by: Choi, Changin, et al.
Published: (2025)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
by: Zhang, Yan, et al.
Published: (2025)
by: Zhang, Yan, et al.
Published: (2025)
Discovering Failure Modes in Vision-Language Models using RL
by: Jain, Kanishk, et al.
Published: (2026)
by: Jain, Kanishk, et al.
Published: (2026)
Using Persuasive Writing Strategies to Explain and Detect Health Misinformation
by: Kamali, Danial, et al.
Published: (2022)
by: Kamali, Danial, et al.
Published: (2022)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
by: Fan, Lin, et al.
Published: (2024)
by: Fan, Lin, et al.
Published: (2024)
Similar Items
-
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
by: Barezi, Elham J., et al.
Published: (2024) -
NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization
by: Kamali, Danial, et al.
Published: (2024) -
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
by: Kamali, Danial, et al.
Published: (2025) -
Teaching Probabilistic Logical Reasoning to Transformers
by: Nafar, Aliakbar, et al.
Published: (2023) -
A Survey on Compositional Learning of AI Models: Theoretical and Experimental Practices
by: Sinha, Sania, et al.
Published: (2024)