Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
Fuente:
arXiv
Salvato in:
| Autori principali: | Cho, Yeongjae, Kim, Taehee, Shin, Heejun, Cho, Sungzoon, Shin, Dongmyung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
di: Kim, Taehee, et al.
Pubblicazione: (2024)
di: Kim, Taehee, et al.
Pubblicazione: (2024)
EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanations
di: Kim, Hyunjong, et al.
Pubblicazione: (2025)
di: Kim, Hyunjong, et al.
Pubblicazione: (2025)
Fast and accurate sparse-view CBCT reconstruction using meta-learned neural attenuation field and hash-encoding regularization
di: Shin, Heejun, et al.
Pubblicazione: (2023)
di: Shin, Heejun, et al.
Pubblicazione: (2023)
Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding
di: Cho, Yeongjae, et al.
Pubblicazione: (2025)
di: Cho, Yeongjae, et al.
Pubblicazione: (2025)
An Interpretable Local Editing Model for Counterfactual Medical Image Generation
di: Min, Hyungi, et al.
Pubblicazione: (2026)
di: Min, Hyungi, et al.
Pubblicazione: (2026)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
Utility of Multimodal Large Language Models in Analyzing Chest X-ray with Incomplete Contextual Information
di: Kim, Choonghan, et al.
Pubblicazione: (2024)
di: Kim, Choonghan, et al.
Pubblicazione: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
di: Ha, Cuong Nhat, et al.
Pubblicazione: (2024)
A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding
di: Pal, Ankit, et al.
Pubblicazione: (2025)
di: Pal, Ankit, et al.
Pubblicazione: (2025)
MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays
di: Cho, Sunghwan Steve, et al.
Pubblicazione: (2026)
di: Cho, Sunghwan Steve, et al.
Pubblicazione: (2026)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
di: Kim, Yunsoo, et al.
Pubblicazione: (2024)
di: Kim, Yunsoo, et al.
Pubblicazione: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
di: Xing, Xiaoying, et al.
Pubblicazione: (2025)
di: Xing, Xiaoying, et al.
Pubblicazione: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
di: Hossain, Md. Zahid, et al.
Pubblicazione: (2026)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
di: Cho, Beomsik, et al.
Pubblicazione: (2025)
di: Cho, Beomsik, et al.
Pubblicazione: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation
di: Kim, Yunsoo, et al.
Pubblicazione: (2025)
di: Kim, Yunsoo, et al.
Pubblicazione: (2025)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
di: Peng, Daowan, et al.
Pubblicazione: (2025)
di: Peng, Daowan, et al.
Pubblicazione: (2025)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
G2L:From Giga-Scale to Cancer-Specific Large-Scale Pathology Foundation Models via Knowledge Distillation
di: Cho, Yesung, et al.
Pubblicazione: (2025)
di: Cho, Yesung, et al.
Pubblicazione: (2025)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
di: Kuang, Jiayi, et al.
Pubblicazione: (2024)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
di: Cai, Chen, et al.
Pubblicazione: (2024)
di: Cai, Chen, et al.
Pubblicazione: (2024)
VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2025)
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2025)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
di: Goetting, Dylan, et al.
Pubblicazione: (2024)
di: Goetting, Dylan, et al.
Pubblicazione: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
di: Kim, Taehee, et al.
Pubblicazione: (2024) -
EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanations
di: Kim, Hyunjong, et al.
Pubblicazione: (2025) -
Fast and accurate sparse-view CBCT reconstruction using meta-learned neural attenuation field and hash-encoding regularization
di: Shin, Heejun, et al.
Pubblicazione: (2023) -
Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding
di: Cho, Yeongjae, et al.
Pubblicazione: (2025) -
An Interpretable Local Editing Model for Counterfactual Medical Image Generation
di: Min, Hyungi, et al.
Pubblicazione: (2026)