Exploring Diverse Methods in Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Panfeng, Yang, Qikai, Geng, Xieming, Zhou, Wenjing, Ding, Zhicheng, Nian, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Regional Style and Color Transfer
par: Ding, Zhicheng, et autres
Publié: (2024)
par: Ding, Zhicheng, et autres
Publié: (2024)
Confidence Trigger Detection: Accelerating Real-time Tracking-by-detection Systems
par: Ding, Zhicheng, et autres
Publié: (2019)
par: Ding, Zhicheng, et autres
Publié: (2019)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024)
par: Barezi, Elham J., et autres
Publié: (2024)
Federated Document Visual Question Answering: A Pilot Study
par: Nguyen, Khanh, et autres
Publié: (2024)
par: Nguyen, Khanh, et autres
Publié: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
par: Gupta, Akash, et autres
Publié: (2025)
par: Gupta, Akash, et autres
Publié: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
par: Fu, Xingyu, et autres
Publié: (2023)
par: Fu, Xingyu, et autres
Publié: (2023)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA
par: Mo, Wentao, et autres
Publié: (2024)
par: Mo, Wentao, et autres
Publié: (2024)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
par: Jiang, Bowen, et autres
Publié: (2024)
par: Jiang, Bowen, et autres
Publié: (2024)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
par: Sinha, Neelabh, et autres
Publié: (2024)
par: Sinha, Neelabh, et autres
Publié: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
MMToM-QA: Multimodal Theory of Mind Question Answering
par: Jin, Chuanyang, et autres
Publié: (2024)
par: Jin, Chuanyang, et autres
Publié: (2024)
CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes
par: Parmar, Paritosh, et autres
Publié: (2024)
par: Parmar, Paritosh, et autres
Publié: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
par: Yeh, Yahsin, et autres
Publié: (2025)
par: Yeh, Yahsin, et autres
Publié: (2025)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
par: Ghosh, Shiv, et autres
Publié: (2026)
par: Ghosh, Shiv, et autres
Publié: (2026)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
par: Srivastava, Varun, et autres
Publié: (2025)
par: Srivastava, Varun, et autres
Publié: (2025)
WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines
par: Winata, Genta Indra, et autres
Publié: (2024)
par: Winata, Genta Indra, et autres
Publié: (2024)
Synthetic Document Question Answering in Hungarian
par: Li, Jonathan, et autres
Publié: (2025)
par: Li, Jonathan, et autres
Publié: (2025)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
par: Shang, Chuyi, et autres
Publié: (2024)
par: Shang, Chuyi, et autres
Publié: (2024)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
par: Kendre, Shrikant, et autres
Publié: (2025)
par: Kendre, Shrikant, et autres
Publié: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
MediFact at MEDIQA-M3G 2024: Medical Question Answering in Dermatology with Multimodal Learning
par: Saeed, Nadia
Publié: (2024)
par: Saeed, Nadia
Publié: (2024)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
par: Butsanets, Léo, et autres
Publié: (2025)
par: Butsanets, Léo, et autres
Publié: (2025)
Privacy-Aware Document Visual Question Answering
par: Tito, Rubèn, et autres
Publié: (2023)
par: Tito, Rubèn, et autres
Publié: (2023)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM
par: Kim, Wonkyun, et autres
Publié: (2024)
par: Kim, Wonkyun, et autres
Publié: (2024)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024)
par: Kim, Wonjoong, et autres
Publié: (2024)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
par: Ding, Zhicheng, et autres
Publié: (2024)
par: Ding, Zhicheng, et autres
Publié: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
par: He, Hulingxiao, et autres
Publié: (2025)
par: He, Hulingxiao, et autres
Publié: (2025)
Top-down Activity Representation Learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024)
par: Wang, Yanan, et autres
Publié: (2024)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
Documents similaires
-
Regional Style and Color Transfer
par: Ding, Zhicheng, et autres
Publié: (2024) -
Confidence Trigger Detection: Accelerating Real-time Tracking-by-detection Systems
par: Ding, Zhicheng, et autres
Publié: (2019) -
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024) -
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024) -
Federated Document Visual Question Answering: A Pilot Study
par: Nguyen, Khanh, et autres
Publié: (2024)