Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Peiyuan, Zhang, Zecheng, Dong, Yiping, Zhou, Li, Wang, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Exploring Diverse Methods in Visual Question Answering
di: Li, Panfeng, et al.
Pubblicazione: (2024)
di: Li, Panfeng, et al.
Pubblicazione: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
di: Yu, Zhou, et al.
Pubblicazione: (2023)
di: Yu, Zhou, et al.
Pubblicazione: (2023)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
di: Dong, Junnan, et al.
Pubblicazione: (2024)
di: Dong, Junnan, et al.
Pubblicazione: (2024)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
di: Peng, Daowan, et al.
Pubblicazione: (2025)
di: Peng, Daowan, et al.
Pubblicazione: (2025)
MMToM-QA: Multimodal Theory of Mind Question Answering
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Moradi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Federated Document Visual Question Answering: A Pilot Study
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh, et al.
Pubblicazione: (2024)
Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA
di: Mo, Wentao, et al.
Pubblicazione: (2024)
di: Mo, Wentao, et al.
Pubblicazione: (2024)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
Answering Questions in Stages: Prompt Chaining for Contract QA
di: Roegiest, Adam, et al.
Pubblicazione: (2024)
di: Roegiest, Adam, et al.
Pubblicazione: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
di: Gupta, Akash, et al.
Pubblicazione: (2025)
di: Gupta, Akash, et al.
Pubblicazione: (2025)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
di: Srivastava, Varun, et al.
Pubblicazione: (2025)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
di: Huai, Tianyu, et al.
Pubblicazione: (2025)
di: Huai, Tianyu, et al.
Pubblicazione: (2025)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
Enhancing Sentiment Analysis through Multimodal Fusion: A BERT-DINOv2 Approach
di: Zhao, Taoxu, et al.
Pubblicazione: (2025)
di: Zhao, Taoxu, et al.
Pubblicazione: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024) -
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024) -
Exploring Diverse Methods in Visual Question Answering
di: Li, Panfeng, et al.
Pubblicazione: (2024) -
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021) -
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
di: Zhang, Jiarui, et al.
Pubblicazione: (2023)