Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thai, Triet Minh, Luu, Son T. |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
par: Nguyen, Ngoc Son, et autres
Publié: (2024)
par: Nguyen, Ngoc Son, et autres
Publié: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Barriers in Integrating Medical Visual Question Answering into Radiology Workflows: A Scoping Review and Clinicians' Insights
par: Mishra, Deepali, et autres
Publié: (2025)
par: Mishra, Deepali, et autres
Publié: (2025)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
par: Inadumi, Shun, et autres
Publié: (2024)
par: Inadumi, Shun, et autres
Publié: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
par: Naik, Nandita Shankar, et autres
Publié: (2024)
par: Naik, Nandita Shankar, et autres
Publié: (2024)
WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines
par: Winata, Genta Indra, et autres
Publié: (2024)
par: Winata, Genta Indra, et autres
Publié: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
par: Ma, Ziyu, et autres
Publié: (2024)
par: Ma, Ziyu, et autres
Publié: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
par: Zhang, Peifeng, et autres
Publié: (2026)
par: Zhang, Peifeng, et autres
Publié: (2026)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
par: Peng, Daowan, et autres
Publié: (2025)
par: Peng, Daowan, et autres
Publié: (2025)
Link prediction Graph Neural Networks for structure recognition of Handwritten Mathematical Expressions
par: Nguyen, Cuong Tuan, et autres
Publié: (2025)
par: Nguyen, Cuong Tuan, et autres
Publié: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
par: Ahmed, Rafid, et autres
Publié: (2026)
par: Ahmed, Rafid, et autres
Publié: (2026)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
par: Kuang, Jiayi, et autres
Publié: (2024)
par: Kuang, Jiayi, et autres
Publié: (2024)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
par: Barua, Deeparghya Dutta, et autres
Publié: (2024)
par: Barua, Deeparghya Dutta, et autres
Publié: (2024)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
par: Serra, Francesco Dalla, et autres
Publié: (2025)
par: Serra, Francesco Dalla, et autres
Publié: (2025)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
par: Zhang, Zhilin, et autres
Publié: (2024)
par: Zhang, Zhilin, et autres
Publié: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
par: Shaaban, Mai A., et autres
Publié: (2025)
par: Shaaban, Mai A., et autres
Publié: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
par: Kim, Jongha, et autres
Publié: (2026)
par: Kim, Jongha, et autres
Publié: (2026)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
par: Cho, Yeongjae, et autres
Publié: (2024)
par: Cho, Yeongjae, et autres
Publié: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Charting the Future: Using Chart Question-Answering for Scalable Evaluation of LLM-Driven Data Visualizations
par: Ford, James, et autres
Publié: (2024)
par: Ford, James, et autres
Publié: (2024)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
par: Kim, Taehee, et autres
Publié: (2024)
par: Kim, Taehee, et autres
Publié: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
par: Hossain, Md. Zahid, et autres
Publié: (2026)
par: Hossain, Md. Zahid, et autres
Publié: (2026)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
par: Loem, Mengsay, et autres
Publié: (2025)
par: Loem, Mengsay, et autres
Publié: (2025)
Documents similaires
-
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
par: Nguyen, Ngoc Son, et autres
Publié: (2024) -
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021) -
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025) -
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024) -
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)