EHRStruct: A Comprehensive Benchmark Framework for Evaluating Large Language Models on Structured Electronic Health Record Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Xiao, Zhao, Xuejiao, Shen, Zhiqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Generalizable Anomaly Detection Method in Dynamic Graphs
di: Yang, Xiao, et al.
Pubblicazione: (2024)
di: Yang, Xiao, et al.
Pubblicazione: (2024)
Are Heterogeneous Graph Neural Networks Truly Effective? A Causal Perspective
di: Yang, Xiao, et al.
Pubblicazione: (2025)
di: Yang, Xiao, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
di: Jahan, Israt, et al.
Pubblicazione: (2023)
di: Jahan, Israt, et al.
Pubblicazione: (2023)
Large Language Models to Identify Social Determinants of Health in Electronic Health Records
di: Guevara, Marco, et al.
Pubblicazione: (2023)
di: Guevara, Marco, et al.
Pubblicazione: (2023)
Benchmarking Foundation Models with Multimodal Public Electronic Health Records
di: Yu, Kunyu, et al.
Pubblicazione: (2025)
di: Yu, Kunyu, et al.
Pubblicazione: (2025)
Large Language Models are Powerful Electronic Health Record Encoders
di: Hegselmann, Stefan, et al.
Pubblicazione: (2025)
di: Hegselmann, Stefan, et al.
Pubblicazione: (2025)
Improving Mortality Prediction After Radiotherapy with Large Language Model Structuring of Large-Scale Unstructured Electronic Health Records
di: Park, Sangjoon, et al.
Pubblicazione: (2024)
di: Park, Sangjoon, et al.
Pubblicazione: (2024)
Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning
di: Luo, Zhimeng, et al.
Pubblicazione: (2025)
di: Luo, Zhimeng, et al.
Pubblicazione: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
EHRSQL: A Practical Text-to-SQL Benchmark for Electronic Health Records
di: Lee, Gyubok, et al.
Pubblicazione: (2023)
di: Lee, Gyubok, et al.
Pubblicazione: (2023)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
EHR-RAG: Bridging Long-Horizon Structured Electronic Health Records and Large Language Models via Enhanced Retrieval-Augmented Generation
di: Cao, Lang, et al.
Pubblicazione: (2026)
di: Cao, Lang, et al.
Pubblicazione: (2026)
Integrating Large Language Models with Human Expertise for Disease Detection in Electronic Health Records
di: Pan, Jie, et al.
Pubblicazione: (2025)
di: Pan, Jie, et al.
Pubblicazione: (2025)
Generative Foundation Model for Structured and Unstructured Electronic Health Records
di: Sivarajkumar, Sonish, et al.
Pubblicazione: (2025)
di: Sivarajkumar, Sonish, et al.
Pubblicazione: (2025)
REALM: RAG-Driven Enhancement of Multimodal Electronic Health Records Analysis via Large Language Models
di: Zhu, Yinghao, et al.
Pubblicazione: (2024)
di: Zhu, Yinghao, et al.
Pubblicazione: (2024)
Towards Goal-oriented Prompt Engineering for Large Language Models: A Survey
di: Li, Haochen, et al.
Pubblicazione: (2024)
di: Li, Haochen, et al.
Pubblicazione: (2024)
CEHR-XGPT: A Scalable Multi-Task Foundation Model for Electronic Health Records
di: Pang, Chao, et al.
Pubblicazione: (2025)
di: Pang, Chao, et al.
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
Autocompletion of Chief Complaints in the Electronic Health Records using Large Language Models
di: Islam, K M Sajjadul, et al.
Pubblicazione: (2024)
di: Islam, K M Sajjadul, et al.
Pubblicazione: (2024)
Revolutionizing Database Q&A with Large Language Models: Comprehensive Benchmark and Evaluation
di: Zheng, Yihang, et al.
Pubblicazione: (2024)
di: Zheng, Yihang, et al.
Pubblicazione: (2024)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
Prompting Large Language Models for Zero-Shot Clinical Prediction with Structured Longitudinal Electronic Health Record Data
di: Zhu, Yinghao, et al.
Pubblicazione: (2024)
di: Zhu, Yinghao, et al.
Pubblicazione: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
What is the best model? Application-driven Evaluation for Large Language Models
di: Lian, Shiguo, et al.
Pubblicazione: (2024)
di: Lian, Shiguo, et al.
Pubblicazione: (2024)
FeatEHR-LLM: Leveraging Large Language Models for Feature Engineering in Electronic Health Records
di: Karami, Hojjat, et al.
Pubblicazione: (2026)
di: Karami, Hojjat, et al.
Pubblicazione: (2026)
Evaluation of General Large Language Models in Contextually Assessing Semantic Concepts Extracted from Adult Critical Care Electronic Health Record Notes
di: Liu, Darren, et al.
Pubblicazione: (2024)
di: Liu, Darren, et al.
Pubblicazione: (2024)
COMET: Benchmark for Comprehensive Biological Multi-omics Evaluation Tasks and Language Models
di: Ren, Yuchen, et al.
Pubblicazione: (2024)
di: Ren, Yuchen, et al.
Pubblicazione: (2024)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
di: Zheng, Baolin, et al.
Pubblicazione: (2025)
di: Zheng, Baolin, et al.
Pubblicazione: (2025)
Recent Advances in Predictive Modeling with Electronic Health Records
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
Applying and Evaluating Large Language Models in Mental Health Care: A Scoping Review of Human-Assessed Generative Tasks
di: Hua, Yining, et al.
Pubblicazione: (2024)
di: Hua, Yining, et al.
Pubblicazione: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
Cancer Diagnosis Categorization in Electronic Health Records Using Large Language Models and BioBERT: Model Performance Evaluation Study
di: Hashtarkhani, Soheil, et al.
Pubblicazione: (2025)
di: Hashtarkhani, Soheil, et al.
Pubblicazione: (2025)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
di: Li, Yige, et al.
Pubblicazione: (2024)
di: Li, Yige, et al.
Pubblicazione: (2024)
CEFW: A Comprehensive Evaluation Framework for Watermark in Large Language Models
di: Zhang, Shuhao, et al.
Pubblicazione: (2025)
di: Zhang, Shuhao, et al.
Pubblicazione: (2025)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Generalizable Anomaly Detection Method in Dynamic Graphs
di: Yang, Xiao, et al.
Pubblicazione: (2024) -
Are Heterogeneous Graph Neural Networks Truly Effective? A Causal Perspective
di: Yang, Xiao, et al.
Pubblicazione: (2025) -
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
di: Ren, Weijieying, et al.
Pubblicazione: (2025) -
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025) -
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
di: Jahan, Israt, et al.
Pubblicazione: (2023)