Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dalmia, Shivali, Mantravadi, Ananya, Desikan, Prasanna |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
par: Desikan, Prasanna, et autres
Publié: (2026)
par: Desikan, Prasanna, et autres
Publié: (2026)
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
par: Mantravadi, Ananya, et autres
Publié: (2026)
par: Mantravadi, Ananya, et autres
Publié: (2026)
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
par: Mantravadi, Ananya, et autres
Publié: (2025)
par: Mantravadi, Ananya, et autres
Publié: (2025)
Automated Auditing of Hospital Discharge Summaries for Care Transitions
par: Dasula, Akshat, et autres
Publié: (2026)
par: Dasula, Akshat, et autres
Publié: (2026)
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025)
par: Rajgarhia, Harshit, et autres
Publié: (2025)
Scalable multilingual PII annotation for responsible AI in LLMs
par: Meena, Bharti, et autres
Publié: (2025)
par: Meena, Bharti, et autres
Publié: (2025)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
par: Rajgarhia, Harshit, et autres
Publié: (2026)
par: Rajgarhia, Harshit, et autres
Publié: (2026)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
par: Yang, Rushuai, et autres
Publié: (2026)
par: Yang, Rushuai, et autres
Publié: (2026)
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models
par: Hameed, Sameeah Noreen, et autres
Publié: (2025)
par: Hameed, Sameeah Noreen, et autres
Publié: (2025)
Retrieval-Augmented Large Language Models for Schema-Constrained Clinical Information Extraction
par: Karim, A H M Rezaul, et autres
Publié: (2026)
par: Karim, A H M Rezaul, et autres
Publié: (2026)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
par: Joshi, Ananya, et autres
Publié: (2025)
par: Joshi, Ananya, et autres
Publié: (2025)
Systematic Comparative Analysis of Large Pretrained Language Models on Contextualized Medication Event Extraction
par: Abdul-Quddoos, Tariq, et autres
Publié: (2025)
par: Abdul-Quddoos, Tariq, et autres
Publié: (2025)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
par: Xie, Tinghao, et autres
Publié: (2024)
par: Xie, Tinghao, et autres
Publié: (2024)
Systematic Evaluation of Knowledge Graph Repair with Large Language Models
par: Lin, Tung-Wei, et autres
Publié: (2025)
par: Lin, Tung-Wei, et autres
Publié: (2025)
Chinese Discharge Drug Recommendation in Metabolic Diseases with Large Language Models
par: Li, Juntao, et autres
Publié: (2025)
par: Li, Juntao, et autres
Publié: (2025)
AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach
par: Pathak, Gangesh, et autres
Publié: (2025)
par: Pathak, Gangesh, et autres
Publié: (2025)
Model Tuning or Prompt Tuning? A Study of Large Language Models for Clinical Concept and Relation Extraction
par: Peng, Cheng, et autres
Publié: (2023)
par: Peng, Cheng, et autres
Publié: (2023)
Bias in Large Language Models Across Clinical Applications: A Systematic Review
par: Suenghataiphorn, Thanathip, et autres
Publié: (2025)
par: Suenghataiphorn, Thanathip, et autres
Publié: (2025)
Resource-Conscious Modeling for Next- Day Discharge Prediction Using Clinical Notes
par: Cho, Ha Na, et autres
Publié: (2026)
par: Cho, Ha Na, et autres
Publié: (2026)
Revisiting In-Context Learning with Long Context Language Models
par: Baek, Jinheon, et autres
Publié: (2024)
par: Baek, Jinheon, et autres
Publié: (2024)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
par: Zhang, Xiao, et autres
Publié: (2026)
par: Zhang, Xiao, et autres
Publié: (2026)
Responsible AI in Construction Safety: Systematic Evaluation of Large Language Models and Prompt Engineering
par: Sammour, Farouq, et autres
Publié: (2024)
par: Sammour, Farouq, et autres
Publié: (2024)
Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Systematic Analysis
par: Yoon, Hong-Jun, et autres
Publié: (2025)
par: Yoon, Hong-Jun, et autres
Publié: (2025)
Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs
par: Makkuni, Rhea, et autres
Publié: (2026)
par: Makkuni, Rhea, et autres
Publié: (2026)
GenRES: Rethinking Evaluation for Generative Relation Extraction in the Era of Large Language Models
par: Jiang, Pengcheng, et autres
Publié: (2024)
par: Jiang, Pengcheng, et autres
Publié: (2024)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
par: Huang, Jerry, et autres
Publié: (2024)
par: Huang, Jerry, et autres
Publié: (2024)
Harnessing Large Language Models for Precision Querying and Retrieval-Augmented Knowledge Extraction in Clinical Data Science
par: Jan, Juan Jose Rubio, et autres
Publié: (2026)
par: Jan, Juan Jose Rubio, et autres
Publié: (2026)
MSDiagnosis: A Benchmark for Evaluating Large Language Models in Multi-Step Clinical Diagnosis
par: Hou, Ruihui, et autres
Publié: (2024)
par: Hou, Ruihui, et autres
Publié: (2024)
Systematic Weight Evaluation for Pruning Large Language Models: Enhancing Performance and Sustainability
par: Islam, Ashhadul, et autres
Publié: (2025)
par: Islam, Ashhadul, et autres
Publié: (2025)
Improving Large Language Model Planning with Action Sequence Similarity
par: Zhao, Xinran, et autres
Publié: (2025)
par: Zhao, Xinran, et autres
Publié: (2025)
Evaluation of Causal Reasoning for Large Language Models in Contextualized Clinical Scenarios of Laboratory Test Interpretation
par: Bhasuran, Balu, et autres
Publié: (2025)
par: Bhasuran, Balu, et autres
Publié: (2025)
CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment
par: Zhu, Yakun, et autres
Publié: (2025)
par: Zhu, Yakun, et autres
Publié: (2025)
Experience Scaling: Post-Deployment Evolution For Large Language Models
par: Yin, Xingkun, et autres
Publié: (2025)
par: Yin, Xingkun, et autres
Publié: (2025)
Optimal Question Selection from a Large Question Bank for Clinical Field Recovery in Conversational Psychiatric Intake
par: Gui, Guan, et autres
Publié: (2026)
par: Gui, Guan, et autres
Publié: (2026)
A Systematic Approach for Large Language Models Debugging
par: Shbita, Basel, et autres
Publié: (2026)
par: Shbita, Basel, et autres
Publié: (2026)
Meronymic Ontology Extraction via Large Language Models
par: Zhang, Dekai, et autres
Publié: (2025)
par: Zhang, Dekai, et autres
Publié: (2025)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
par: Li, Zheqing, et autres
Publié: (2025)
par: Li, Zheqing, et autres
Publié: (2025)
Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models
par: Chiu, Christopher, et autres
Publié: (2025)
par: Chiu, Christopher, et autres
Publié: (2025)
LLM+AL: Bridging Large Language Models and Action Languages for Complex Reasoning about Actions
par: Ishay, Adam, et autres
Publié: (2025)
par: Ishay, Adam, et autres
Publié: (2025)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
par: Parmar, Mihir, et autres
Publié: (2024)
par: Parmar, Mihir, et autres
Publié: (2024)
Documents similaires
-
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
par: Desikan, Prasanna, et autres
Publié: (2026) -
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
par: Mantravadi, Ananya, et autres
Publié: (2026) -
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
par: Mantravadi, Ananya, et autres
Publié: (2025) -
Automated Auditing of Hospital Discharge Summaries for Care Transitions
par: Dasula, Akshat, et autres
Publié: (2026) -
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025)