MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Hao, Yuexing, Alhamoud, Kumail, Jeong, Hyewon, Zhang, Haoran, Puri, Isha, Torr, Philip, Schaekermann, Mike, Stern, Ariel D., Ghassemi, Marzyeh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2025)
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2025)
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
by: Alhamoud, Kumail, et al.
Published: (2024)
by: Alhamoud, Kumail, et al.
Published: (2024)
Aggregation Hides Out-of-Distribution Generalization Failures from Spurious Correlations
by: Salaudeen, Olawale, et al.
Published: (2025)
by: Salaudeen, Olawale, et al.
Published: (2025)
Vision-Language Models Do Not Understand Negation
by: Alhamoud, Kumail, et al.
Published: (2025)
by: Alhamoud, Kumail, et al.
Published: (2025)
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026)
by: Moraitaki, Charikleia, et al.
Published: (2026)
The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making
by: Gourabathina, Abinitha, et al.
Published: (2025)
by: Gourabathina, Abinitha, et al.
Published: (2025)
Can AI Relate: Testing Large Language Model Response for Mental Health Support
by: Gabriel, Saadia, et al.
Published: (2024)
by: Gabriel, Saadia, et al.
Published: (2024)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2025)
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2025)
MaskMedPaint: Masked Medical Image Inpainting with Diffusion Models for Mitigation of Spurious Correlations
by: Jin, Qixuan, et al.
Published: (2024)
by: Jin, Qixuan, et al.
Published: (2024)
Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
by: Puri, Isha, et al.
Published: (2026)
by: Puri, Isha, et al.
Published: (2026)
Robustness Beyond Known Groups with Low-rank Adaptation
by: Gourabathina, Abinitha, et al.
Published: (2026)
by: Gourabathina, Abinitha, et al.
Published: (2026)
Event-Based Contrastive Learning for Medical Time Series
by: Jeong, Hyewon, et al.
Published: (2023)
by: Jeong, Hyewon, et al.
Published: (2023)
LEMoN: Label Error Detection using Multimodal Neighbors
by: Zhang, Haoran, et al.
Published: (2024)
by: Zhang, Haoran, et al.
Published: (2024)
Measuring Stochastic Data Complexity with Boltzmann Influence Functions
by: Ng, Nathan, et al.
Published: (2024)
by: Ng, Nathan, et al.
Published: (2024)
Views Can Be Deceiving: Improved SSL Through Feature Space Augmentation
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
Improving Black-box Robustness with In-Context Rewriting
by: O'Brien, Kyle, et al.
Published: (2024)
by: O'Brien, Kyle, et al.
Published: (2024)
MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making
by: Kim, Yubin, et al.
Published: (2024)
by: Kim, Yubin, et al.
Published: (2024)
Identifying Implicit Social Biases in Vision-Language Models
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
by: Xiao, Yuxin, et al.
Published: (2025)
by: Xiao, Yuxin, et al.
Published: (2025)
MedLM: Exploring Language Models for Medical Question Answering Systems
by: Yagnik, Niraj, et al.
Published: (2024)
by: Yagnik, Niraj, et al.
Published: (2024)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
by: Kim, Yunsoo, et al.
Published: (2024)
by: Kim, Yunsoo, et al.
Published: (2024)
MedTrust-RAG: Evidence Verification and Trust Alignment for Biomedical Question Answering
by: Ning, Yingpeng, et al.
Published: (2025)
by: Ning, Yingpeng, et al.
Published: (2025)
A System for Accurate Tracking and Video Recordings of Rodent Eye Movements using Convolutional Neural Networks for Biomedical Image Segmentation
by: Puri, Isha, et al.
Published: (2025)
by: Puri, Isha, et al.
Published: (2025)
MedCoT-RAG: Causal Chain-of-Thought RAG for Medical Question Answering
by: Wang, Ziyu, et al.
Published: (2025)
by: Wang, Ziyu, et al.
Published: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
by: Xi, Suyang, et al.
Published: (2026)
by: Xi, Suyang, et al.
Published: (2026)
MedFuzz: Exploring the Robustness of Large Language Models in Medical Question Answering
by: Ness, Robert Osazuwa, et al.
Published: (2024)
by: Ness, Robert Osazuwa, et al.
Published: (2024)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
by: Nguyen, Hai-Dang, et al.
Published: (2025)
by: Nguyen, Hai-Dang, et al.
Published: (2025)
MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers
by: Färber, Fernanda Bufon, et al.
Published: (2025)
by: Färber, Fernanda Bufon, et al.
Published: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024)
by: Alonso, Iñigo, et al.
Published: (2024)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
by: Xiao, Ying, et al.
Published: (2025)
by: Xiao, Ying, et al.
Published: (2025)
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
by: Abu-Daoud, Mouath, et al.
Published: (2026)
by: Abu-Daoud, Mouath, et al.
Published: (2026)
Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track
by: Gupta, Deepak, et al.
Published: (2024)
by: Gupta, Deepak, et al.
Published: (2024)
LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering
by: Ma, Runze, et al.
Published: (2026)
by: Ma, Runze, et al.
Published: (2026)
MedGellan: LLM-Generated Medical Guidance to Support Physicians
by: Banerjee, Debodeep, et al.
Published: (2025)
by: Banerjee, Debodeep, et al.
Published: (2025)
Hedging and Non-Affirmation: Quantifying LLM Alignment on Questions of Human Rights
by: Javed, Rafiya, et al.
Published: (2025)
by: Javed, Rafiya, et al.
Published: (2025)
MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
MedLogic-AQA: Enhancing Medical Question Answering with Abstractive Models Focusing on Logical Structures
by: Zafar, Aizan, et al.
Published: (2024)
by: Zafar, Aizan, et al.
Published: (2024)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
by: Jin, Congyun, et al.
Published: (2024)
by: Jin, Congyun, et al.
Published: (2024)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
by: Wei, Jianhui, et al.
Published: (2025)
by: Wei, Jianhui, et al.
Published: (2025)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
by: Gai, Xiaotang, et al.
Published: (2024)
by: Gai, Xiaotang, et al.
Published: (2024)
Similar Items
-
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2025) -
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
by: Alhamoud, Kumail, et al.
Published: (2024) -
Aggregation Hides Out-of-Distribution Generalization Failures from Spurious Correlations
by: Salaudeen, Olawale, et al.
Published: (2025) -
Vision-Language Models Do Not Understand Negation
by: Alhamoud, Kumail, et al.
Published: (2025) -
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026)