STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Guohao, Qin, Can, Fu, Huazhu, Wang, Linwei, Tao, Zhiqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
von: Sun, Guohao, et al.
Veröffentlicht: (2024)
von: Sun, Guohao, et al.
Veröffentlicht: (2024)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025)
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track
von: Gupta, Deepak, et al.
Veröffentlicht: (2024)
von: Gupta, Deepak, et al.
Veröffentlicht: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
von: Gai, Xiaotang, et al.
Veröffentlicht: (2024)
von: Gai, Xiaotang, et al.
Veröffentlicht: (2024)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
MedCFVQA: A Causal Approach to Mitigate Modality Preference Bias in Medical Visual Question Answering
von: Ye, Shuchang, et al.
Veröffentlicht: (2025)
von: Ye, Shuchang, et al.
Veröffentlicht: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration
von: Zhang, Chenran, et al.
Veröffentlicht: (2026)
von: Zhang, Chenran, et al.
Veröffentlicht: (2026)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
Vision-Language Model IP Protection via Prompt-based Learning
von: Wang, Lianyu, et al.
Veröffentlicht: (2025)
von: Wang, Lianyu, et al.
Veröffentlicht: (2025)
UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models
von: Liao, Zehui, et al.
Veröffentlicht: (2025)
von: Liao, Zehui, et al.
Veröffentlicht: (2025)
Vivim: a Video Vision Mamba for Medical Video Segmentation
von: Yang, Yijun, et al.
Veröffentlicht: (2024)
von: Yang, Yijun, et al.
Veröffentlicht: (2024)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
von: Li, Lei, et al.
Veröffentlicht: (2024)
von: Li, Lei, et al.
Veröffentlicht: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
von: Zhu, Younan, et al.
Veröffentlicht: (2025)
von: Zhu, Younan, et al.
Veröffentlicht: (2025)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
von: Wang, Jiahao, et al.
Veröffentlicht: (2024)
von: Wang, Jiahao, et al.
Veröffentlicht: (2024)
FRCNet Frequency and Region Consistency for Semi-supervised Medical Image Segmentation
von: He, Along, et al.
Veröffentlicht: (2024)
von: He, Along, et al.
Veröffentlicht: (2024)
Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
von: Xu, Dunyuan, et al.
Veröffentlicht: (2026)
von: Xu, Dunyuan, et al.
Veröffentlicht: (2026)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
von: Meng, Tian, et al.
Veröffentlicht: (2024)
von: Meng, Tian, et al.
Veröffentlicht: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
von: Hartsock, Iryna, et al.
Veröffentlicht: (2024)
von: Hartsock, Iryna, et al.
Veröffentlicht: (2024)
Yo'LLaVA: Your Personalized Language and Vision Assistant
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
von: Shah, Monika, et al.
Veröffentlicht: (2025)
von: Shah, Monika, et al.
Veröffentlicht: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
von: Felizzi, Federico, et al.
Veröffentlicht: (2025)
von: Felizzi, Federico, et al.
Veröffentlicht: (2025)
Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering
von: Khan, Zaid, et al.
Veröffentlicht: (2024)
von: Khan, Zaid, et al.
Veröffentlicht: (2024)
3D Question Answering via only 2D Vision-Language Models
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
von: Wang, Fengyun, et al.
Veröffentlicht: (2025)
LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering
von: Ma, Runze, et al.
Veröffentlicht: (2026)
von: Ma, Runze, et al.
Veröffentlicht: (2026)
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
von: Xin, Yu, et al.
Veröffentlicht: (2025)
von: Xin, Yu, et al.
Veröffentlicht: (2025)
Where do Large Vision-Language Models Look at when Answering Questions?
von: Xing, Xiaoying, et al.
Veröffentlicht: (2025)
von: Xing, Xiaoying, et al.
Veröffentlicht: (2025)
Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
von: Mahdavi, Zahra, et al.
Veröffentlicht: (2025)
von: Mahdavi, Zahra, et al.
Veröffentlicht: (2025)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
von: Chen, Jin, et al.
Veröffentlicht: (2024)
von: Chen, Jin, et al.
Veröffentlicht: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
von: Zou, Bo, et al.
Veröffentlicht: (2024)
von: Zou, Bo, et al.
Veröffentlicht: (2024)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
von: Gao, Yifan, et al.
Veröffentlicht: (2026)
von: Gao, Yifan, et al.
Veröffentlicht: (2026)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
von: Sun, Guohao, et al.
Veröffentlicht: (2024) -
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025) -
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
von: Inal, Gokce, et al.
Veröffentlicht: (2026) -
Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track
von: Gupta, Deepak, et al.
Veröffentlicht: (2024) -
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)