Visually Interpretable Subtask Reasoning for Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Yu, Goel, Arushi, Bilen, Hakan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
por: Peng, Jingwei, et al.
Publicado: (2025)
por: Peng, Jingwei, et al.
Publicado: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
por: Lassoued, Aymen, et al.
Publicado: (2026)
por: Lassoued, Aymen, et al.
Publicado: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)
por: Lim, Su Hyeon, et al.
Publicado: (2024)
HumMorph: Generalized Dynamic Human Neural Fields from Few Views
por: Zadrożny, Jakub, et al.
Publicado: (2025)
por: Zadrożny, Jakub, et al.
Publicado: (2025)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
por: Ishihara, Keishi, et al.
Publicado: (2025)
por: Ishihara, Keishi, et al.
Publicado: (2025)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
por: Xi, Suyang, et al.
Publicado: (2026)
por: Xi, Suyang, et al.
Publicado: (2026)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
por: Shanker, Shambhavi, et al.
Publicado: (2025)
por: Shanker, Shambhavi, et al.
Publicado: (2025)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
por: Jing, Liu, et al.
Publicado: (2025)
por: Jing, Liu, et al.
Publicado: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
por: Movva, Prahitha, et al.
Publicado: (2025)
por: Movva, Prahitha, et al.
Publicado: (2025)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
por: Tran, Duong T., et al.
Publicado: (2025)
por: Tran, Duong T., et al.
Publicado: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
por: Xue, Junxiao, et al.
Publicado: (2024)
por: Xue, Junxiao, et al.
Publicado: (2024)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
por: Wang, Zeqing, et al.
Publicado: (2023)
por: Wang, Zeqing, et al.
Publicado: (2023)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
por: Fu, Xingyu, et al.
Publicado: (2023)
por: Fu, Xingyu, et al.
Publicado: (2023)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
por: Kapuriya, Janak, et al.
Publicado: (2025)
por: Kapuriya, Janak, et al.
Publicado: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
por: Gou, Chenhui, et al.
Publicado: (2025)
por: Gou, Chenhui, et al.
Publicado: (2025)
VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering
por: Chen, Jiayi, et al.
Publicado: (2026)
por: Chen, Jiayi, et al.
Publicado: (2026)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
por: Chen, Pingyi, et al.
Publicado: (2024)
por: Chen, Pingyi, et al.
Publicado: (2024)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
por: Jain, Riddhi, et al.
Publicado: (2025)
por: Jain, Riddhi, et al.
Publicado: (2025)
DriveLM: Driving with Graph Visual Question Answering
por: Sima, Chonghao, et al.
Publicado: (2023)
por: Sima, Chonghao, et al.
Publicado: (2023)
Object Retrieval for Visual Question Answering with Outside Knowledge
por: Kan, Shichao, et al.
Publicado: (2024)
por: Kan, Shichao, et al.
Publicado: (2024)
Universal representations:The missing link between faces, text, planktons, and cat breeds
por: Bilen, Hakan, et al.
Publicado: (2017)
por: Bilen, Hakan, et al.
Publicado: (2017)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
por: Wang, Junjie, et al.
Publicado: (2025)
por: Wang, Junjie, et al.
Publicado: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
por: Wen, Zhihao, et al.
Publicado: (2025)
por: Wen, Zhihao, et al.
Publicado: (2025)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
por: Ye, Qilang, et al.
Publicado: (2024)
por: Ye, Qilang, et al.
Publicado: (2024)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
por: Cheng, Wanyin, et al.
Publicado: (2025)
por: Cheng, Wanyin, et al.
Publicado: (2025)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
por: Xu, Tao
Publicado: (2026)
por: Xu, Tao
Publicado: (2026)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
por: Wang, Zhisong, et al.
Publicado: (2026)
por: Wang, Zhisong, et al.
Publicado: (2026)
PAOLI: Pose-free Articulated Object Learning from Sparse-view Images
por: Deng, Jianning, et al.
Publicado: (2025)
por: Deng, Jianning, et al.
Publicado: (2025)
Ejemplares similares
-
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
por: Peng, Jingwei, et al.
Publicado: (2025) -
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024) -
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024) -
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
por: Lassoued, Aymen, et al.
Publicado: (2026) -
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)