A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Inadumi, Shun, Kawano, Seiya, Yuguchi, Akishige, Kawanishi, Yasutomo, Yoshino, Koichiro |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
J-CRe3: A Japanese Conversation Dataset for Real-world Reference Resolution
par: Ueda, Nobuhiro, et autres
Publié: (2024)
par: Ueda, Nobuhiro, et autres
Publié: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
par: Nam, Heejeong, et autres
Publié: (2024)
par: Nam, Heejeong, et autres
Publié: (2024)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
par: Barua, Deeparghya Dutta, et autres
Publié: (2024)
par: Barua, Deeparghya Dutta, et autres
Publié: (2024)
Disambiguating Reference in Visually Grounded Dialogues through Joint Modeling of Textual and Multimodal Semantic Structures
par: Inadumi, Shun, et autres
Publié: (2025)
par: Inadumi, Shun, et autres
Publié: (2025)
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
par: Ahmed, Rafid, et autres
Publié: (2026)
par: Ahmed, Rafid, et autres
Publié: (2026)
AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
par: Jang, Jihyoung, et autres
Publié: (2026)
par: Jang, Jihyoung, et autres
Publié: (2026)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
Asking Multimodal Clarifying Questions in Mixed-Initiative Conversational Search
par: Yuan, Yifei, et autres
Publié: (2024)
par: Yuan, Yifei, et autres
Publié: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
par: Naik, Nandita Shankar, et autres
Publié: (2024)
par: Naik, Nandita Shankar, et autres
Publié: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
par: Nguyen, Ngoc Son, et autres
Publié: (2024)
par: Nguyen, Ngoc Son, et autres
Publié: (2024)
SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts
par: Inadumi, Shun, et autres
Publié: (2025)
par: Inadumi, Shun, et autres
Publié: (2025)
Multi-View Video-Based Learning: Leveraging Weak Labels for Frame-Level Perception
par: John, Vijay, et autres
Publié: (2024)
par: John, Vijay, et autres
Publié: (2024)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement
par: Hasan, Mohammed Rakibul, et autres
Publié: (2025)
par: Hasan, Mohammed Rakibul, et autres
Publié: (2025)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
par: Zhang, Peifeng, et autres
Publié: (2026)
par: Zhang, Peifeng, et autres
Publié: (2026)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
par: Peng, Daowan, et autres
Publié: (2025)
par: Peng, Daowan, et autres
Publié: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
par: Kuang, Jiayi, et autres
Publié: (2024)
par: Kuang, Jiayi, et autres
Publié: (2024)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
par: Serra, Francesco Dalla, et autres
Publié: (2025)
par: Serra, Francesco Dalla, et autres
Publié: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering
par: Katsube, Toshiki, et autres
Publié: (2025)
par: Katsube, Toshiki, et autres
Publié: (2025)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
par: Kim, Taehee, et autres
Publié: (2024)
par: Kim, Taehee, et autres
Publié: (2024)
Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering
par: Thai, Triet Minh, et autres
Publié: (2023)
par: Thai, Triet Minh, et autres
Publié: (2023)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
par: Shaaban, Mai A., et autres
Publié: (2025)
par: Shaaban, Mai A., et autres
Publié: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
par: Kim, Jongha, et autres
Publié: (2026)
par: Kim, Jongha, et autres
Publié: (2026)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
par: Butsanets, Léo, et autres
Publié: (2025)
par: Butsanets, Léo, et autres
Publié: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
par: Hossain, Md. Zahid, et autres
Publié: (2026)
par: Hossain, Md. Zahid, et autres
Publié: (2026)
Barriers in Integrating Medical Visual Question Answering into Radiology Workflows: A Scoping Review and Clinicians' Insights
par: Mishra, Deepali, et autres
Publié: (2025)
par: Mishra, Deepali, et autres
Publié: (2025)
Documents similaires
-
J-CRe3: A Japanese Conversation Dataset for Real-world Reference Resolution
par: Ueda, Nobuhiro, et autres
Publié: (2024) -
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021) -
VAGUE: Visual Contexts Clarify Ambiguous Expressions
par: Nam, Heejeong, et autres
Publié: (2024) -
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024) -
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
par: Barua, Deeparghya Dutta, et autres
Publié: (2024)