Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Rahman, Salman, Jiang, Lavender Yao, Gabriel, Saadia, Aphinyanaphongs, Yindalon, Oermann, Eric Karl, Chunara, Rumi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks
by: Vishwanath, Krithik, et al.
Published: (2025)
by: Vishwanath, Krithik, et al.
Published: (2025)
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
by: Kapoor, Anjali K., et al.
Published: (2026)
by: Kapoor, Anjali K., et al.
Published: (2026)
Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs
by: Jiang, Lavender Y., et al.
Published: (2026)
by: Jiang, Lavender Y., et al.
Published: (2026)
Impact on Public Health Decision Making by Utilizing Big Data Without Domain Knowledge
by: Zhang, Miao, et al.
Published: (2024)
by: Zhang, Miao, et al.
Published: (2024)
Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models
by: Chen, Yanbing, et al.
Published: (2024)
by: Chen, Yanbing, et al.
Published: (2024)
Understanding Disparities in Post Hoc Machine Learning Explanation
by: Mhasawade, Vishwali, et al.
Published: (2024)
by: Mhasawade, Vishwali, et al.
Published: (2024)
BPQA Dataset: Evaluating How Well Language Models Leverage Blood Pressures to Answer Biomedical Questions
by: Hang, Chi, et al.
Published: (2025)
by: Hang, Chi, et al.
Published: (2025)
Disparate Effect Of Missing Mediators On Transportability of Causal Effects
by: Mhasawade, Vishwali, et al.
Published: (2024)
by: Mhasawade, Vishwali, et al.
Published: (2024)
Identity-Robust Language Model Generation via Content Integrity Preservation
by: Zhang, Miao, et al.
Published: (2026)
by: Zhang, Miao, et al.
Published: (2026)
AI Safety in Generative AI Large Language Models: A Survey
by: Chua, Jaymari, et al.
Published: (2024)
by: Chua, Jaymari, et al.
Published: (2024)
It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education
by: Singh, Shrutika, et al.
Published: (2025)
by: Singh, Shrutika, et al.
Published: (2025)
Generalist Foundation Models Are Not Clinical Enough for Hospital Operations
by: Jiang, Lavender Y., et al.
Published: (2025)
by: Jiang, Lavender Y., et al.
Published: (2025)
The World of Generative AI: Deepfakes and Large Language Models
by: Mitra, Alakananda, et al.
Published: (2024)
by: Mitra, Alakananda, et al.
Published: (2024)
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
by: Jotautaitė, Monika, et al.
Published: (2025)
by: Jotautaitė, Monika, et al.
Published: (2025)
Dual Use Concerns of Generative AI and Large Language Models
by: Grinbaum, Alexei, et al.
Published: (2023)
by: Grinbaum, Alexei, et al.
Published: (2023)
Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
by: Ding, Kexin, et al.
Published: (2025)
by: Ding, Kexin, et al.
Published: (2025)
Will Large Language Models Transform Clinical Prediction?
by: Yildiz, Yusuf, et al.
Published: (2025)
by: Yildiz, Yusuf, et al.
Published: (2025)
AGGA: A Dataset of Academic Guidelines for Generative AI and Large Language Models
by: Jiao, Junfeng, et al.
Published: (2025)
by: Jiao, Junfeng, et al.
Published: (2025)
Large Language Models and Forensic Linguistics: Navigating Opportunities and Threats in the Age of Generative AI
by: Mikros, George
Published: (2025)
by: Mikros, George
Published: (2025)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
by: Aljohani, Manar, et al.
Published: (2025)
by: Aljohani, Manar, et al.
Published: (2025)
MalAlgoQA: Pedagogical Evaluation of Counterfactual Reasoning in Large Language Models and Implications for AI in Education
by: Liu, Naiming, et al.
Published: (2024)
by: Liu, Naiming, et al.
Published: (2024)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
Extrinsic Evaluation of Cultural Competence in Large Language Models
by: Bhatt, Shaily, et al.
Published: (2024)
by: Bhatt, Shaily, et al.
Published: (2024)
Configurable Fairness: Direct Optimization of Parity Metrics via Vision-Language Models
by: Zhang, Miao, et al.
Published: (2024)
by: Zhang, Miao, et al.
Published: (2024)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
by: Liu, Yiran, et al.
Published: (2024)
by: Liu, Yiran, et al.
Published: (2024)
Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations
by: Pewinya, Githma, et al.
Published: (2026)
by: Pewinya, Githma, et al.
Published: (2026)
New-Onset Diabetes Assessment Using Artificial Intelligence-Enhanced Electrocardiography
by: Zhang, Hao, et al.
Published: (2022)
by: Zhang, Hao, et al.
Published: (2022)
Evaluating open-source Large Language Models for automated fact-checking
by: Fontana, Nicolo', et al.
Published: (2025)
by: Fontana, Nicolo', et al.
Published: (2025)
Towards Equitable AI: Detecting Bias in Using Large Language Models for Marketing
by: Yilmaz, Berk, et al.
Published: (2025)
by: Yilmaz, Berk, et al.
Published: (2025)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
Understanding Teacher Revisions of Large Language Model-Generated Feedback
by: Borchers, Conrad, et al.
Published: (2026)
by: Borchers, Conrad, et al.
Published: (2026)
Regulating Large Language Models: A Roundtable Report
by: Nicholas, Gabriel, et al.
Published: (2024)
by: Nicholas, Gabriel, et al.
Published: (2024)
Can AI Relate: Testing Large Language Model Response for Mental Health Support
by: Gabriel, Saadia, et al.
Published: (2024)
by: Gabriel, Saadia, et al.
Published: (2024)
What do Large Language Models Say About Animals? Investigating Risks of Animal Harm in Generated Text
by: Kanepajs, Arturs, et al.
Published: (2025)
by: Kanepajs, Arturs, et al.
Published: (2025)
Evaluation of AI Ethics Tools in Language Models: A Developers' Perspective Case Study
by: Silva, Jhessica, et al.
Published: (2025)
by: Silva, Jhessica, et al.
Published: (2025)
Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions
by: Zhu, Wang Bill, et al.
Published: (2025)
by: Zhu, Wang Bill, et al.
Published: (2025)
Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor
by: Shafiei, Mohammadamin, et al.
Published: (2025)
by: Shafiei, Mohammadamin, et al.
Published: (2025)
Leveraging Large Language Models for Actionable Course Evaluation Student Feedback to Lecturers
by: Zhang, Mike, et al.
Published: (2024)
by: Zhang, Mike, et al.
Published: (2024)
Topic-aware Large Language Models for Summarizing the Lived Healthcare Experiences Described in Health Stories
by: Bilalpur, Maneesh, et al.
Published: (2025)
by: Bilalpur, Maneesh, et al.
Published: (2025)
Smart Trial: Evaluating the Use of Large Language Models for Recruiting Clinical Trial Participants via Social Media
by: Zhou, Xiaofan, et al.
Published: (2025)
by: Zhou, Xiaofan, et al.
Published: (2025)
Similar Items
-
Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks
by: Vishwanath, Krithik, et al.
Published: (2025) -
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
by: Kapoor, Anjali K., et al.
Published: (2026) -
Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs
by: Jiang, Lavender Y., et al.
Published: (2026) -
Impact on Public Health Decision Making by Utilizing Big Data Without Domain Knowledge
by: Zhang, Miao, et al.
Published: (2024) -
Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models
by: Chen, Yanbing, et al.
Published: (2024)