Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Jusung, Cha, Sungguk, Lee, Younghyun, Yang, Cheoljong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visually Dehallucinative Instruction Generation
par: Cha, Sungguk, et autres
Publié: (2024)
par: Cha, Sungguk, et autres
Publié: (2024)
Visually Dehallucinative Instruction Generation: Know What You Don't Know
par: Cha, Sungguk, et autres
Publié: (2024)
par: Cha, Sungguk, et autres
Publié: (2024)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
par: Iyer, Vijayasri, et autres
Publié: (2026)
par: Iyer, Vijayasri, et autres
Publié: (2026)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
par: Zeng, Xingchen, et autres
Publié: (2024)
par: Zeng, Xingchen, et autres
Publié: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
par: Lee, Dosung, et autres
Publié: (2025)
par: Lee, Dosung, et autres
Publié: (2025)
Multimodal Rationales for Explainable Visual Question Answering
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
Visual Instruction Pretraining for Domain-Specific Foundation Models
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
par: Hossain, Md. Zahid, et autres
Publié: (2026)
par: Hossain, Md. Zahid, et autres
Publié: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
par: Choi, Changin, et autres
Publié: (2025)
par: Choi, Changin, et autres
Publié: (2025)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
par: Kim, Hongyeob, et autres
Publié: (2025)
par: Kim, Hongyeob, et autres
Publié: (2025)
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
par: Xu, Pusheng, et autres
Publié: (2025)
par: Xu, Pusheng, et autres
Publié: (2025)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
par: Xue, Junxiao, et autres
Publié: (2024)
par: Xue, Junxiao, et autres
Publié: (2024)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
par: Peng, Jingwei, et autres
Publié: (2025)
par: Peng, Jingwei, et autres
Publié: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
par: Movva, Prahitha, et autres
Publié: (2025)
par: Movva, Prahitha, et autres
Publié: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
Targeted Visual Prompting for Medical Visual Question Answering
par: Tascon-Morales, Sergio, et autres
Publié: (2024)
par: Tascon-Morales, Sergio, et autres
Publié: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
par: Cheng, Yu, et autres
Publié: (2025)
par: Cheng, Yu, et autres
Publié: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)
par: Kim, Youngmin, et autres
Publié: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
par: Wang, Yuduo, et autres
Publié: (2023)
par: Wang, Yuduo, et autres
Publié: (2023)
Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera
par: Song, Inpyo, et autres
Publié: (2024)
par: Song, Inpyo, et autres
Publié: (2024)
Text-conditioned State Space Model For Domain-generalized Change Detection Visual Question Answering
par: Ghazaei, Elman, et autres
Publié: (2025)
par: Ghazaei, Elman, et autres
Publié: (2025)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
par: Meng, Tian, et autres
Publié: (2024)
par: Meng, Tian, et autres
Publié: (2024)
PTQ4VM: Post-Training Quantization for Visual Mamba
par: Cho, Younghyun, et autres
Publié: (2024)
par: Cho, Younghyun, et autres
Publié: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
par: Pham, Tan-Hanh, et autres
Publié: (2024)
par: Pham, Tan-Hanh, et autres
Publié: (2024)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
par: Gai, Xiaotang, et autres
Publié: (2024)
par: Gai, Xiaotang, et autres
Publié: (2024)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
par: Lim, Qi Zhi, et autres
Publié: (2025)
par: Lim, Qi Zhi, et autres
Publié: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
par: SR, Nikitha
Publié: (2025)
par: SR, Nikitha
Publié: (2025)
Documents similaires
-
Visually Dehallucinative Instruction Generation
par: Cha, Sungguk, et autres
Publié: (2024) -
Visually Dehallucinative Instruction Generation: Know What You Don't Know
par: Cha, Sungguk, et autres
Publié: (2024) -
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
par: Iyer, Vijayasri, et autres
Publié: (2026) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
par: Zeng, Xingchen, et autres
Publié: (2024) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
par: Lee, Dosung, et autres
Publié: (2025)