Object Attribute Matters in Visual Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Peize, Si, Qingyi, Fu, Peng, Lin, Zheng, Wang, Yan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
por: Li, Peize, et al.
Publicado: (2024)
por: Li, Peize, et al.
Publicado: (2024)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
por: Ahir, Param, et al.
Publicado: (2023)
por: Ahir, Param, et al.
Publicado: (2023)
Towards Flexible Evaluation for Generative Visual Question Answering
por: Ji, Huishan, et al.
Publicado: (2024)
por: Ji, Huishan, et al.
Publicado: (2024)
Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering
por: Li, Zhifei, et al.
Publicado: (2025)
por: Li, Zhifei, et al.
Publicado: (2025)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
por: Chen, Pingyi, et al.
Publicado: (2024)
por: Chen, Pingyi, et al.
Publicado: (2024)
Multi-Sourced Compositional Generalization in Visual Question Answering
por: Li, Chuanhao, et al.
Publicado: (2025)
por: Li, Chuanhao, et al.
Publicado: (2025)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
por: Xu, Pusheng, et al.
Publicado: (2025)
por: Xu, Pusheng, et al.
Publicado: (2025)
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering
por: Chen, Yuhan, et al.
Publicado: (2024)
por: Chen, Yuhan, et al.
Publicado: (2024)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
por: Xi, Suyang, et al.
Publicado: (2026)
por: Xi, Suyang, et al.
Publicado: (2026)
Free Form Medical Visual Question Answering in Radiology
por: Narayanan, Abhishek, et al.
Publicado: (2024)
por: Narayanan, Abhishek, et al.
Publicado: (2024)
Saliency Guided Longitudinal Medical Visual Question Answering
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
por: Fu, Xingyu, et al.
Publicado: (2023)
por: Fu, Xingyu, et al.
Publicado: (2023)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
por: Özdemir, Övgü, et al.
Publicado: (2024)
por: Özdemir, Övgü, et al.
Publicado: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
por: Rajkhowa, Tonmoy, et al.
Publicado: (2024)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
por: Zhang, Junkai, et al.
Publicado: (2025)
por: Zhang, Junkai, et al.
Publicado: (2025)
IIU: Independent Inference Units for Knowledge-based Visual Question Answering
por: Li, Yili, et al.
Publicado: (2024)
por: Li, Yili, et al.
Publicado: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
por: Zhao, Henry Hengyuan, et al.
Publicado: (2024)
por: Zhao, Henry Hengyuan, et al.
Publicado: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
por: Shen, Zhixuan, et al.
Publicado: (2024)
por: Shen, Zhixuan, et al.
Publicado: (2024)
Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering
por: Marouf, Imad Eddine, et al.
Publicado: (2025)
por: Marouf, Imad Eddine, et al.
Publicado: (2025)
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
por: Wieczorek, Tobias Jan, et al.
Publicado: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
por: Hagen, Luca, et al.
Publicado: (2026)
por: Hagen, Luca, et al.
Publicado: (2026)
Location-Aware Pretraining for Medical Difference Visual Question Answering
por: Musinguzi, Denis, et al.
Publicado: (2026)
por: Musinguzi, Denis, et al.
Publicado: (2026)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
por: Han, Hongyong, et al.
Publicado: (2025)
por: Han, Hongyong, et al.
Publicado: (2025)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
por: Liu, Ying, et al.
Publicado: (2024)
por: Liu, Ying, et al.
Publicado: (2024)
Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection
por: Fu, Jinhu, et al.
Publicado: (2026)
por: Fu, Jinhu, et al.
Publicado: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
por: Vu, Sinh Trong, et al.
Publicado: (2025)
por: Vu, Sinh Trong, et al.
Publicado: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
por: Jain, Riddhi, et al.
Publicado: (2025)
por: Jain, Riddhi, et al.
Publicado: (2025)
Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering
por: Shen, Ruoyue, et al.
Publicado: (2024)
por: Shen, Ruoyue, et al.
Publicado: (2024)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
por: Shourya, Aditya, et al.
Publicado: (2025)
por: Shourya, Aditya, et al.
Publicado: (2025)
LingoQA: Visual Question Answering for Autonomous Driving
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
por: Mao, Xianwei, et al.
Publicado: (2026)
por: Mao, Xianwei, et al.
Publicado: (2026)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
por: Shbita, Basel, et al.
Publicado: (2026)
por: Shbita, Basel, et al.
Publicado: (2026)
Ejemplares similares
-
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
por: Li, Peize, et al.
Publicado: (2024) -
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
por: Ahir, Param, et al.
Publicado: (2023) -
Towards Flexible Evaluation for Generative Visual Question Answering
por: Ji, Huishan, et al.
Publicado: (2024) -
Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering
por: Li, Zhifei, et al.
Publicado: (2025) -
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
por: Chen, Pingyi, et al.
Publicado: (2024)