Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Zhuohong, Wu, Zhenxian, Yu, Yunyao, Xu, Hangrui, Liao, Zirui, Liu, Zhifang, Deng, Xiangwen, Jiao, Pen, Wang, Haoqian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling
di: Yu, Yunyao, et al.
Pubblicazione: (2026)
di: Yu, Yunyao, et al.
Pubblicazione: (2026)
PSGait: Gait Recognition using Parsing Skeleton
di: Xu, Hangrui, et al.
Pubblicazione: (2025)
di: Xu, Hangrui, et al.
Pubblicazione: (2025)
R3G: A Reasoning--Retrieval--Reranking Framework for Vision-Centric Answer Generation
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
DAGait: Generalized Skeleton-Guided Data Alignment for Gait Recognition
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
di: Deng, Jiaqi, et al.
Pubblicazione: (2025)
di: Deng, Jiaqi, et al.
Pubblicazione: (2025)
Language-Guided and Motion-Aware Gait Representation for Generalizable Recognition
di: Wu, Zhengxian, et al.
Pubblicazione: (2026)
di: Wu, Zhengxian, et al.
Pubblicazione: (2026)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
Object Retrieval for Visual Question Answering with Outside Knowledge
di: Kan, Shichao, et al.
Pubblicazione: (2024)
di: Kan, Shichao, et al.
Pubblicazione: (2024)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
di: Peng, Daowan, et al.
Pubblicazione: (2025)
di: Peng, Daowan, et al.
Pubblicazione: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
di: Xia, Canming, et al.
Pubblicazione: (2026)
di: Xia, Canming, et al.
Pubblicazione: (2026)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
di: Hong, Yuyang, et al.
Pubblicazione: (2026)
di: Hong, Yuyang, et al.
Pubblicazione: (2026)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
di: Wang, Junjie, et al.
Pubblicazione: (2025)
di: Wang, Junjie, et al.
Pubblicazione: (2025)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
di: Weng, Weixi, et al.
Pubblicazione: (2024)
di: Weng, Weixi, et al.
Pubblicazione: (2024)
Reconstruction as a Bridge for Event-Based Visual Question Answering
di: Lou, Hanyue, et al.
Pubblicazione: (2025)
di: Lou, Hanyue, et al.
Pubblicazione: (2025)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
di: Ahir, Param, et al.
Pubblicazione: (2023)
di: Ahir, Param, et al.
Pubblicazione: (2023)
IIU: Independent Inference Units for Knowledge-based Visual Question Answering
di: Li, Yili, et al.
Pubblicazione: (2024)
di: Li, Yili, et al.
Pubblicazione: (2024)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
di: Tao, Qian, et al.
Pubblicazione: (2025)
di: Tao, Qian, et al.
Pubblicazione: (2025)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
di: Deng, Jiaqi, et al.
Pubblicazione: (2025)
di: Deng, Jiaqi, et al.
Pubblicazione: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering
di: Jin, Mengyuan, et al.
Pubblicazione: (2026)
di: Jin, Mengyuan, et al.
Pubblicazione: (2026)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering
di: Liu, Zhiyue, et al.
Pubblicazione: (2025)
di: Liu, Zhiyue, et al.
Pubblicazione: (2025)
VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
di: Vardi, Ben, et al.
Pubblicazione: (2025)
di: Vardi, Ben, et al.
Pubblicazione: (2025)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
di: Lassoued, Aymen, et al.
Pubblicazione: (2026)
Path-RAG: Knowledge-Guided Key Region Retrieval for Open-ended Pathology Visual Question Answering
di: Naeem, Awais, et al.
Pubblicazione: (2024)
di: Naeem, Awais, et al.
Pubblicazione: (2024)
From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling
di: Yu, Yunyao, et al.
Pubblicazione: (2026) -
PSGait: Gait Recognition using Parsing Skeleton
di: Xu, Hangrui, et al.
Pubblicazione: (2025) -
R3G: A Reasoning--Retrieval--Reranking Framework for Vision-Centric Answer Generation
di: Chen, Zhuohong, et al.
Pubblicazione: (2026) -
DAGait: Generalized Skeleton-Guided Data Alignment for Gait Recognition
di: Wu, Zhengxian, et al.
Pubblicazione: (2025) -
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
di: Deng, Jiaqi, et al.
Pubblicazione: (2025)