Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sinha, Neelabh, Jain, Vinija, Chadha, Aman |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
How Culturally Aware are Vision-Language Models?
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
von: Ghosh, Akash, et al.
Veröffentlicht: (2024)
von: Ghosh, Akash, et al.
Veröffentlicht: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
von: Sahoo, Pranab, et al.
Veröffentlicht: (2024)
von: Sahoo, Pranab, et al.
Veröffentlicht: (2024)
Multilingual State Space Models for Structured Question Answering in Indic Languages
von: Vats, Arpita, et al.
Veröffentlicht: (2025)
von: Vats, Arpita, et al.
Veröffentlicht: (2025)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
von: Sinha, Neelabh
Veröffentlicht: (2025)
von: Sinha, Neelabh
Veröffentlicht: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
von: Lakhanpal, Sanyam, et al.
Veröffentlicht: (2024)
von: Lakhanpal, Sanyam, et al.
Veröffentlicht: (2024)
Selectively Answering Visual Questions
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
von: Rawal, Niyati, et al.
Veröffentlicht: (2026)
von: Rawal, Niyati, et al.
Veröffentlicht: (2026)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
von: Peng, Daowan, et al.
Veröffentlicht: (2025)
von: Peng, Daowan, et al.
Veröffentlicht: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
von: Zhu, Yingjian, et al.
Veröffentlicht: (2026)
von: Zhu, Yingjian, et al.
Veröffentlicht: (2026)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
von: An, Wenbin, et al.
Veröffentlicht: (2024)
von: An, Wenbin, et al.
Veröffentlicht: (2024)
Hallucination Benchmark in Medical Visual Question Answering
von: Wu, Jinge, et al.
Veröffentlicht: (2024)
von: Wu, Jinge, et al.
Veröffentlicht: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
von: Compagnoni, Alberto, et al.
Veröffentlicht: (2025)
von: Compagnoni, Alberto, et al.
Veröffentlicht: (2025)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
von: Cho, Yeongjae, et al.
Veröffentlicht: (2024)
von: Cho, Yeongjae, et al.
Veröffentlicht: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
von: Cocchi, Federico, et al.
Veröffentlicht: (2024)
von: Cocchi, Federico, et al.
Veröffentlicht: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
Assessing LLM Reliability on Temporally Recent Open-Domain Questions
von: Krishnappa, Pushwitha, et al.
Veröffentlicht: (2026)
von: Krishnappa, Pushwitha, et al.
Veröffentlicht: (2026)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
von: Ma, Ziyu, et al.
Veröffentlicht: (2024)
von: Ma, Ziyu, et al.
Veröffentlicht: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
von: Xing, Xiaoying, et al.
Veröffentlicht: (2025)
von: Xing, Xiaoying, et al.
Veröffentlicht: (2025)
Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development
von: Sahoo, Pranab, et al.
Veröffentlicht: (2024)
von: Sahoo, Pranab, et al.
Veröffentlicht: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
Exploring Diverse Methods in Visual Question Answering
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
von: Hossain, Md. Zahid, et al.
Veröffentlicht: (2026)
von: Hossain, Md. Zahid, et al.
Veröffentlicht: (2026)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
von: Pranav, Tushar, et al.
Veröffentlicht: (2025)
von: Pranav, Tushar, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024) -
How Culturally Aware are Vision-Language Models?
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024) -
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
von: Ghosh, Akash, et al.
Veröffentlicht: (2024) -
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024) -
A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
von: Sahoo, Pranab, et al.
Veröffentlicht: (2024)