Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hartsock, Iryna, Rasool, Ghulam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
par: Li, Bingxin
Publié: (2025)
par: Li, Bingxin
Publié: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
par: Chahe, Amirhosein, et autres
Publié: (2025)
par: Chahe, Amirhosein, et autres
Publié: (2025)
Brain-Inspired Continual Learning-Robust Feature Distillation and Re-Consolidation for Class Incremental Learning
par: Khan, Hikmat, et autres
Publié: (2024)
par: Khan, Hikmat, et autres
Publié: (2024)
Adversarially Diversified Rehearsal Memory (ADRM): Mitigating Memory Overfitting Challenge in Continual Learning
par: Khan, Hikmat, et autres
Publié: (2024)
par: Khan, Hikmat, et autres
Publié: (2024)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
par: Sakib, Syed Nazmus, et autres
Publié: (2025)
par: Sakib, Syed Nazmus, et autres
Publié: (2025)
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)
par: Vu, Tai, et autres
Publié: (2025)
Describe Anything Model for Visual Question Answering on Text-rich Images
par: Vu, Yen-Linh, et autres
Publié: (2025)
par: Vu, Yen-Linh, et autres
Publié: (2025)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
par: Wang, Yuduo, et autres
Publié: (2023)
par: Wang, Yuduo, et autres
Publié: (2023)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025)
par: Ma, Haodi, et autres
Publié: (2025)
Expert Knowledge-Aware Image Difference Graph Representation Learning for Difference-Aware Medical Visual Question Answering
par: Hu, Xinyue, et autres
Publié: (2023)
par: Hu, Xinyue, et autres
Publié: (2023)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
par: Sinha, Neelabh, et autres
Publié: (2024)
par: Sinha, Neelabh, et autres
Publié: (2024)
RECODE: Reasoning Through Code Generation for Visual Question Answering
par: Shen, Junhong, et autres
Publié: (2025)
par: Shen, Junhong, et autres
Publié: (2025)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
par: Park, Yohan, et autres
Publié: (2025)
par: Park, Yohan, et autres
Publié: (2025)
COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark
par: Chintapatla, Ishant, et autres
Publié: (2025)
par: Chintapatla, Ishant, et autres
Publié: (2025)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
par: Yu, Zhou, et autres
Publié: (2023)
par: Yu, Zhou, et autres
Publié: (2023)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
par: Weng, Weixi, et autres
Publié: (2024)
par: Weng, Weixi, et autres
Publié: (2024)
TPCL: Task Progressive Curriculum Learning for Robust Visual Question Answering
par: Akl, Ahmed, et autres
Publié: (2024)
par: Akl, Ahmed, et autres
Publié: (2024)
DocVXQA: Context-Aware Visual Explanations for Document Question Answering
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
par: Souibgui, Mohamed Ali, et autres
Publié: (2025)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
par: Huai, Tianyu, et autres
Publié: (2025)
par: Huai, Tianyu, et autres
Publié: (2025)
Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
par: Mamaghan, Amir Mohammad Karimi, et autres
Publié: (2024)
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
par: Indrehus, Kjetil, et autres
Publié: (2026)
par: Indrehus, Kjetil, et autres
Publié: (2026)
Privacy-Aware Document Visual Question Answering
par: Tito, Rubèn, et autres
Publié: (2023)
par: Tito, Rubèn, et autres
Publié: (2023)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
par: Van-Dinh, Tue-Thu, et autres
Publié: (2025)
Exploring Diverse Methods in Visual Question Answering
par: Li, Panfeng, et autres
Publié: (2024)
par: Li, Panfeng, et autres
Publié: (2024)
Medical Vision Language Models as Policies for Robotic Surgery
par: Muppidi, Akshay, et autres
Publié: (2025)
par: Muppidi, Akshay, et autres
Publié: (2025)
Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
Federated Document Visual Question Answering: A Pilot Study
par: Nguyen, Khanh, et autres
Publié: (2024)
par: Nguyen, Khanh, et autres
Publié: (2024)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024)
par: Chen, Peiyuan, et autres
Publié: (2024)
Attribute-based Visual Reprogramming for Vision-Language Models
par: Cai, Chengyi, et autres
Publié: (2025)
par: Cai, Chengyi, et autres
Publié: (2025)
Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering
par: Zhu, He, et autres
Publié: (2024)
par: Zhu, He, et autres
Publié: (2024)
Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering
par: Alavi, Ali
Publié: (2026)
par: Alavi, Ali
Publié: (2026)
Towards Interpreting Visual Information Processing in Vision-Language Models
par: Neo, Clement, et autres
Publié: (2024)
par: Neo, Clement, et autres
Publié: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
Documents similaires
-
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024) -
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
par: Sun, Guohao, et autres
Publié: (2024) -
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025) -
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
par: Li, Bingxin
Publié: (2025) -
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)