MedExQA: Medical Question Answering Benchmark with Multiple Explanations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Yunsoo, Wu, Jinge, Abdulle, Yusuf, Wu, Honghan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
par: Yeh, Yahsin, et autres
Publié: (2025)
par: Yeh, Yahsin, et autres
Publié: (2025)
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
par: Yang, Hang, et autres
Publié: (2024)
par: Yang, Hang, et autres
Publié: (2024)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
par: Jamali, Naghmeh, et autres
Publié: (2025)
par: Jamali, Naghmeh, et autres
Publié: (2025)
SensorQA: A Question Answering Benchmark for Daily-Life Monitoring
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
par: Jin, Congyun, et autres
Publié: (2024)
par: Jin, Congyun, et autres
Publié: (2024)
MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering
par: Hao, Yuexing, et autres
Publié: (2025)
par: Hao, Yuexing, et autres
Publié: (2025)
A Benchmark for Long-Form Medical Question Answering
par: Hosseini, Pedram, et autres
Publié: (2024)
par: Hosseini, Pedram, et autres
Publié: (2024)
MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
par: Islamaj, Rezarta, et autres
Publié: (2026)
par: Islamaj, Rezarta, et autres
Publié: (2026)
MedLM: Exploring Language Models for Medical Question Answering Systems
par: Yagnik, Niraj, et autres
Publié: (2024)
par: Yagnik, Niraj, et autres
Publié: (2024)
RadEyeVideo: Enhancing general-domain Large Vision Language Model for chest X-ray analysis with video representations of eye gaze
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
Uncertainty Estimation of Large Language Models in Medical Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
Collaboration among Multiple Large Language Models for Medical Question Answering
par: Shang, Kexin, et autres
Publié: (2025)
par: Shang, Kexin, et autres
Publié: (2025)
MedBioRAG: Semantic Search and Retrieval-Augmented Generation with Large Language Models for Medical and Biological QA
par: Kim, Seonok
Publié: (2025)
par: Kim, Seonok
Publié: (2025)
To Reason or Not to: Selective Chain-of-Thought in Medical Question Answering
par: Zhan, Zaifu, et autres
Publié: (2026)
par: Zhan, Zaifu, et autres
Publié: (2026)
WikiMixQA: A Multimodal Benchmark for Question Answering over Tables and Charts
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
MedBioLM: Optimizing Medical and Biological QA with Fine-Tuned Large Language Models and Retrieval-Augmented Generation
par: Kim, Seonok
Publié: (2025)
par: Kim, Seonok
Publié: (2025)
QA-TOOLBOX: Conversational Question-Answering for process task guidance in manufacturing
par: Manuvinakurike, Ramesh, et autres
Publié: (2024)
par: Manuvinakurike, Ramesh, et autres
Publié: (2024)
pdfQA: Diverse, Challenging, and Realistic Question Answering over PDFs
par: Schimanski, Tobias, et autres
Publié: (2026)
par: Schimanski, Tobias, et autres
Publié: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
par: Jiang, Hongda, et autres
Publié: (2025)
par: Jiang, Hongda, et autres
Publié: (2025)
From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
par: Li, Lei, et autres
Publié: (2025)
par: Li, Lei, et autres
Publié: (2025)
Biomedical Entity Linking as Multiple Choice Question Answering
par: Lin, Zhenxi, et autres
Publié: (2024)
par: Lin, Zhenxi, et autres
Publié: (2024)
KoBBQ: Korean Bias Benchmark for Question Answering
par: Jin, Jiho, et autres
Publié: (2023)
par: Jin, Jiho, et autres
Publié: (2023)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
par: Xiao, Ying, et autres
Publié: (2025)
par: Xiao, Ying, et autres
Publié: (2025)
FinTextQA: A Dataset for Long-form Financial Question Answering
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
ExpliCIT-QA: Explainable Code-Based Image Table Question Answering
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
par: Lagos, Maximiliano Hormazábal, et autres
Publié: (2025)
Improving LLM Reliability with RAG in Religious Question-Answering: MufassirQAS
par: Alan, Ahmet Yusuf, et autres
Publié: (2024)
par: Alan, Ahmet Yusuf, et autres
Publié: (2024)
Efficient Medical Question Answering with Knowledge-Augmented Question Generation
par: Khlaut, Julien, et autres
Publié: (2024)
par: Khlaut, Julien, et autres
Publié: (2024)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
par: Alonso, Iñigo, et autres
Publié: (2024)
par: Alonso, Iñigo, et autres
Publié: (2024)
MMToM-QA: Multimodal Theory of Mind Question Answering
par: Jin, Chuanyang, et autres
Publié: (2024)
par: Jin, Chuanyang, et autres
Publié: (2024)
Documents similaires
-
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024) -
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
par: Kim, Yunsoo, et autres
Publié: (2024) -
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
par: Kim, Yunsoo, et autres
Publié: (2025) -
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025) -
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
par: Wu, Jinge, et autres
Publié: (2024)