Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Yunpeng, Yang, Carl, Mai, Mark, Hu, Xiao, Shu, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
par: Yao, Zonghai, et autres
Publié: (2024)
par: Yao, Zonghai, et autres
Publié: (2024)
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
par: Yang, Hang, et autres
Publié: (2024)
par: Yang, Hang, et autres
Publié: (2024)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding
par: Xiao, Yunpeng, et autres
Publié: (2025)
par: Xiao, Yunpeng, et autres
Publié: (2025)
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
par: Hsu, Hsin-Ling, et autres
Publié: (2026)
par: Hsu, Hsin-Ling, et autres
Publié: (2026)
RealMedQA: A pilot biomedical question answering dataset containing realistic clinical questions
par: Kell, Gregory, et autres
Publié: (2024)
par: Kell, Gregory, et autres
Publié: (2024)
Cognitive Bias in Decision-Making with LLMs
par: Echterhoff, Jessica, et autres
Publié: (2024)
par: Echterhoff, Jessica, et autres
Publié: (2024)
Med42-v2: A Suite of Clinical LLMs
par: Christophe, Clément, et autres
Publié: (2024)
par: Christophe, Clément, et autres
Publié: (2024)
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment
par: Hong, Chang, et autres
Publié: (2025)
par: Hong, Chang, et autres
Publié: (2025)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
Beyond QA Pairs: Assessing Parameter-Efficient Fine-Tuning for Fact Embedding in LLMs
par: Ratnakar, Shivam, et autres
Publié: (2025)
par: Ratnakar, Shivam, et autres
Publié: (2025)
On the Decision-Making Abilities in Role-Playing using Large Language Models
par: Shen, Chenglei, et autres
Publié: (2024)
par: Shen, Chenglei, et autres
Publié: (2024)
HALO: Hallucination Analysis and Learning Optimization to Empower LLMs with Retrieval-Augmented Context for Guided Clinical Decision Making
par: Anjum, Sumera, et autres
Publié: (2024)
par: Anjum, Sumera, et autres
Publié: (2024)
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
par: Bonomo, Tommaso, et autres
Publié: (2025)
par: Bonomo, Tommaso, et autres
Publié: (2025)
OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
par: Shen, Jiyuan, et autres
Publié: (2026)
par: Shen, Jiyuan, et autres
Publié: (2026)
Benchmarking and Adapting On-Device LLMs for Clinical Decision Support
par: Munim, Alif, et autres
Publié: (2025)
par: Munim, Alif, et autres
Publié: (2025)
MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication
par: Sambara, Sraavya, et autres
Publié: (2026)
par: Sambara, Sraavya, et autres
Publié: (2026)
Towards Optimizing and Evaluating a Retrieval Augmented QA Chatbot using LLMs with Human in the Loop
par: Afzal, Anum, et autres
Publié: (2024)
par: Afzal, Anum, et autres
Publié: (2024)
MedSpeak: A Knowledge Graph-Aided ASR Error Correction Framework for Spoken Medical QA
par: Song, Yutong, et autres
Publié: (2026)
par: Song, Yutong, et autres
Publié: (2026)
Stephanie2: Thinking, Waiting, and Making Decisions Like Humans in Step-by-Step AI Social Chat
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
par: Huang, Jen-tse, et autres
Publié: (2024)
par: Huang, Jen-tse, et autres
Publié: (2024)
MedCT: A Clinical Terminology Graph for Generative AI Applications in Healthcare
par: Chen, Ye, et autres
Publié: (2025)
par: Chen, Ye, et autres
Publié: (2025)
STRUX: An LLM for Decision-Making with Structured Explanations
par: Lu, Yiming, et autres
Publié: (2024)
par: Lu, Yiming, et autres
Publié: (2024)
MedKP: Medical Dialogue with Knowledge Enhancement and Clinical Pathway Encoding
par: Wu, Jiageng, et autres
Publié: (2024)
par: Wu, Jiageng, et autres
Publié: (2024)
EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation
par: Causio, Francesco Andrea, et autres
Publié: (2026)
par: Causio, Francesco Andrea, et autres
Publié: (2026)
MedBioRAG: Semantic Search and Retrieval-Augmented Generation with Large Language Models for Medical and Biological QA
par: Kim, Seonok
Publié: (2025)
par: Kim, Seonok
Publié: (2025)
Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments
par: Xia, Boyang, et autres
Publié: (2026)
par: Xia, Boyang, et autres
Publié: (2026)
BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text
par: Wu, Jiageng, et autres
Publié: (2025)
par: Wu, Jiageng, et autres
Publié: (2025)
MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making
par: Kim, Yubin, et autres
Publié: (2024)
par: Kim, Yubin, et autres
Publié: (2024)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
par: Wu, Yihao, et autres
Publié: (2025)
par: Wu, Yihao, et autres
Publié: (2025)
Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios
par: Lee, Sangyub, et autres
Publié: (2026)
par: Lee, Sangyub, et autres
Publié: (2026)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
par: Cheng, Xiang, et autres
Publié: (2025)
par: Cheng, Xiang, et autres
Publié: (2025)
MedCite: Can Language Models Generate Verifiable Text for Medicine?
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Learning to Correct for QA Reasoning with Black-box LLMs
par: Kim, Jaehyung, et autres
Publié: (2024)
par: Kim, Jaehyung, et autres
Publié: (2024)
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
par: Liu, Yesheng, et autres
Publié: (2025)
par: Liu, Yesheng, et autres
Publié: (2025)
MedBioLM: Optimizing Medical and Biological QA with Fine-Tuned Large Language Models and Retrieval-Augmented Generation
par: Kim, Seonok
Publié: (2025)
par: Kim, Seonok
Publié: (2025)
Slimming Down LLMs Without Losing Their Minds
par: Qingda, et autres
Publié: (2025)
par: Qingda, et autres
Publié: (2025)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
par: Yang, Lin, et autres
Publié: (2026)
par: Yang, Lin, et autres
Publié: (2026)
Documents similaires
-
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
par: Yao, Zonghai, et autres
Publié: (2024) -
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
par: Yang, Hang, et autres
Publié: (2024) -
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025) -
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025) -
Understanding and Tackling Label Errors in Individual-Level Nature Language Understanding
par: Xiao, Yunpeng, et autres
Publié: (2025)