Enregistré dans:
| Auteurs principaux: | Xu, Quanxing, Zhou, Ling, Zhong, Xian, Zhang, Feifei, Huang, Rubing, Lin, Chia-Wen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.03337 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
par: Xu, Quanxing, et autres
Publié: (2025)
par: Xu, Quanxing, et autres
Publié: (2025)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
par: Kim, Hongyeob, et autres
Publié: (2025)
par: Kim, Hongyeob, et autres
Publié: (2025)
Unifying Image Processing as Visual Prompting Question Answering
par: Liu, Yihao, et autres
Publié: (2023)
par: Liu, Yihao, et autres
Publié: (2023)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
par: Özdemir, Övgü, et autres
Publié: (2024)
par: Özdemir, Övgü, et autres
Publié: (2024)
Visual Question Answering on Multiple Remote Sensing Image Modalities
par: Boussaid, Hichem, et autres
Publié: (2025)
par: Boussaid, Hichem, et autres
Publié: (2025)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
par: Cheng, Yu, et autres
Publié: (2025)
par: Cheng, Yu, et autres
Publié: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
par: Tascon-Morales, Sergio, et autres
Publié: (2024)
par: Tascon-Morales, Sergio, et autres
Publié: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
Multimodal Rationales for Explainable Visual Question Answering
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
par: SR, Nikitha
Publié: (2025)
par: SR, Nikitha
Publié: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
Reconstruction as a Bridge for Event-Based Visual Question Answering
par: Lou, Hanyue, et autres
Publié: (2025)
par: Lou, Hanyue, et autres
Publié: (2025)
Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation
par: Liu, Gang, et autres
Publié: (2024)
par: Liu, Gang, et autres
Publié: (2024)
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025)
par: Vu, Yen-Linh, et autres
Publié: (2025)
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
par: Lin, Yuxin, et autres
Publié: (2025)
par: Lin, Yuxin, et autres
Publié: (2025)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
par: Chaybouti, Sofian, et autres
Publié: (2025)
par: Chaybouti, Sofian, et autres
Publié: (2025)
A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering
par: Huang, Xiaofei, et autres
Publié: (2022)
par: Huang, Xiaofei, et autres
Publié: (2022)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
par: Zhong, Liangyu, et autres
Publié: (2025)
par: Zhong, Liangyu, et autres
Publié: (2025)
Prompt-based Personalized Federated Learning for Medical Visual Question Answering
par: Zhu, He, et autres
Publié: (2024)
par: Zhu, He, et autres
Publié: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images
par: Tosato, Lucrezia, et autres
Publié: (2024)
par: Tosato, Lucrezia, et autres
Publié: (2024)
DriveLM: Driving with Graph Visual Question Answering
par: Sima, Chonghao, et autres
Publié: (2023)
par: Sima, Chonghao, et autres
Publié: (2023)
Object Retrieval for Visual Question Answering with Outside Knowledge
par: Kan, Shichao, et autres
Publié: (2024)
par: Kan, Shichao, et autres
Publié: (2024)
Structure Causal Models and LLMs Integration in Medical Visual Question Answering
par: Xu, Zibo, et autres
Publié: (2025)
par: Xu, Zibo, et autres
Publié: (2025)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
Foundational Question Generation for Video Question Answering via an Embedding-Integrated Approach
par: Oh, Ju-Young
Publié: (2025)
par: Oh, Ju-Young
Publié: (2025)
Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering
par: Chen, Zhuohong, et autres
Publié: (2026)
par: Chen, Zhuohong, et autres
Publié: (2026)
Documents similaires
-
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026) -
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
par: Xu, Quanxing, et autres
Publié: (2026) -
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
par: Xu, Quanxing, et autres
Publié: (2025) -
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025) -
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)