KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Choi, Byungjin, Bae, Seongsu, Kweon, Sunjun, Choi, Edward |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024)
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024)
Overview of the EHRSQL 2024 Shared Task on Reliable Text-to-SQL Modeling on Electronic Health Records
von: Lee, Gyubok, et al.
Veröffentlicht: (2024)
von: Lee, Gyubok, et al.
Veröffentlicht: (2024)
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
von: Lee, Jiyoung, et al.
Veröffentlicht: (2024)
von: Lee, Jiyoung, et al.
Veröffentlicht: (2024)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2024)
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2024)
AOR: Anatomical Ontology-Guided Reasoning for Medical Large Multimodal Model in Chest X-Ray Interpretation
von: Li, Qingqiu, et al.
Veröffentlicht: (2025)
von: Li, Qingqiu, et al.
Veröffentlicht: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
von: Yan, Qiao, et al.
Veröffentlicht: (2025)
von: Yan, Qiao, et al.
Veröffentlicht: (2025)
Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
von: Kim, Minchan, et al.
Veröffentlicht: (2024)
von: Kim, Minchan, et al.
Veröffentlicht: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
von: Kim, Yoonshik, et al.
Veröffentlicht: (2025)
von: Kim, Yoonshik, et al.
Veröffentlicht: (2025)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation
von: Koleilat, Taha, et al.
Veröffentlicht: (2026)
von: Koleilat, Taha, et al.
Veröffentlicht: (2026)
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
von: Jin, Yiqiao, et al.
Veröffentlicht: (2024)
von: Jin, Yiqiao, et al.
Veröffentlicht: (2024)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
von: Ju, Jeongho, et al.
Veröffentlicht: (2024)
von: Ju, Jeongho, et al.
Veröffentlicht: (2024)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
von: Kim, Dain, et al.
Veröffentlicht: (2026)
von: Kim, Dain, et al.
Veröffentlicht: (2026)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
von: Yu, Suhao, et al.
Veröffentlicht: (2025)
von: Yu, Suhao, et al.
Veröffentlicht: (2025)
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
von: Saha, Pramit, et al.
Veröffentlicht: (2024)
von: Saha, Pramit, et al.
Veröffentlicht: (2024)
Evaluating Multimodal Generative AI with Korean Educational Standards
von: Park, Sanghee, et al.
Veröffentlicht: (2025)
von: Park, Sanghee, et al.
Veröffentlicht: (2025)
TransLPRNet: Lite Vision-Language Network for Single/Dual-line Chinese License Plate Recognition
von: Xu, Guangzhu, et al.
Veröffentlicht: (2025)
von: Xu, Guangzhu, et al.
Veröffentlicht: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
von: Shang, Fangxin, et al.
Veröffentlicht: (2025)
von: Shang, Fangxin, et al.
Veröffentlicht: (2025)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
von: Wan, Zhongwei, et al.
Veröffentlicht: (2023)
von: Wan, Zhongwei, et al.
Veröffentlicht: (2023)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
von: Liu, Jie, et al.
Veröffentlicht: (2024)
von: Liu, Jie, et al.
Veröffentlicht: (2024)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
von: Bao, Zhijie, et al.
Veröffentlicht: (2026)
von: Bao, Zhijie, et al.
Veröffentlicht: (2026)
Intriguing Properties of Large Language and Vision Models
von: Lee, Young-Jun, et al.
Veröffentlicht: (2024)
von: Lee, Young-Jun, et al.
Veröffentlicht: (2024)
BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models
von: Ye-Bin, Moon, et al.
Veröffentlicht: (2024)
von: Ye-Bin, Moon, et al.
Veröffentlicht: (2024)
MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models
von: Royer, Corentin, et al.
Veröffentlicht: (2024)
von: Royer, Corentin, et al.
Veröffentlicht: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
von: Yu, Haorui, et al.
Veröffentlicht: (2026)
von: Yu, Haorui, et al.
Veröffentlicht: (2026)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
MultiMed: Massively Multimodal and Multitask Medical Understanding
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
von: Zhou, Keyan, et al.
Veröffentlicht: (2025)
von: Zhou, Keyan, et al.
Veröffentlicht: (2025)
MedVisionLlama: Leveraging Pre-Trained Large Language Model Layers to Enhance Medical Image Segmentation
von: Kumar, Gurucharan Marthi Krishna, et al.
Veröffentlicht: (2024)
von: Kumar, Gurucharan Marthi Krishna, et al.
Veröffentlicht: (2024)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
von: Son, Jaemin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
von: Kweon, Sunjun, et al.
Veröffentlicht: (2024) -
Overview of the EHRSQL 2024 Shared Task on Reliable Text-to-SQL Modeling on Electronic Health Records
von: Lee, Gyubok, et al.
Veröffentlicht: (2024) -
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
von: Lee, Jiyoung, et al.
Veröffentlicht: (2024) -
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)