RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Shuhao, Jiang, Weisen, Wang, Changmiao, Wu, Xiaoqing, Shi, Xuanren, Zhang, Yu, Kwok, James T. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
Effective Structured Prompting by Meta-Learning and Representative Verbalizer
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification
von: Jiang, Weisen, et al.
Veröffentlicht: (2026)
von: Jiang, Weisen, et al.
Veröffentlicht: (2026)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
Contrastive Learning on Medical Intents for Sequential Prescription Recommendation
von: Moghaddam, Arya Hadizadeh, et al.
Veröffentlicht: (2024)
von: Moghaddam, Arya Hadizadeh, et al.
Veröffentlicht: (2024)
Dual-Balancing for Multi-Task Learning
von: Lin, Baijiong, et al.
Veröffentlicht: (2023)
von: Lin, Baijiong, et al.
Veröffentlicht: (2023)
MMCircuitEval: A Comprehensive Multimodal Circuit-Focused Benchmark for Evaluating LLMs
von: Zhao, Chenchen, et al.
Veröffentlicht: (2025)
von: Zhao, Chenchen, et al.
Veröffentlicht: (2025)
AcademicEval: Live Long-Context LLM Benchmark
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
von: Pan, Tianjun, et al.
Veröffentlicht: (2026)
von: Pan, Tianjun, et al.
Veröffentlicht: (2026)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
Combating the Bucket Effect:Multi-Knowledge Alignment for Medication Recommendation
von: Li, Xiang, et al.
Veröffentlicht: (2025)
von: Li, Xiang, et al.
Veröffentlicht: (2025)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures
von: Ni, Jinjie, et al.
Veröffentlicht: (2024)
von: Ni, Jinjie, et al.
Veröffentlicht: (2024)
Multi-LLM Collaboration for Medication Recommendation
von: Sanchez, Huascar, et al.
Veröffentlicht: (2025)
von: Sanchez, Huascar, et al.
Veröffentlicht: (2025)
ARMR: Adaptively Responsive Network for Medication Recommendation
von: Wu, Feiyue, et al.
Veröffentlicht: (2025)
von: Wu, Feiyue, et al.
Veröffentlicht: (2025)
InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation
von: Yang, Yifan, et al.
Veröffentlicht: (2026)
von: Yang, Yifan, et al.
Veröffentlicht: (2026)
MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
von: Jiang, Yixing, et al.
Veröffentlicht: (2025)
von: Jiang, Yixing, et al.
Veröffentlicht: (2025)
Unifying Lane-Level Traffic Prediction from a Graph Structural Perspective: Benchmark and Baseline
von: Li, Shuhao, et al.
Veröffentlicht: (2024)
von: Li, Shuhao, et al.
Veröffentlicht: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
von: Chung, Tsz Ting, et al.
Veröffentlicht: (2025)
von: Chung, Tsz Ting, et al.
Veröffentlicht: (2025)
SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks
von: Jorf, Baraa Al, et al.
Veröffentlicht: (2026)
von: Jorf, Baraa Al, et al.
Veröffentlicht: (2026)
StreamFP: Learnable Fingerprint-guided Data Selection for Efficient Stream Learning
von: Shi, Tongjun, et al.
Veröffentlicht: (2024)
von: Shi, Tongjun, et al.
Veröffentlicht: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Energy Efficiency in AI for 5G and Beyond: A DeepRx Case Study
von: Lbath, Amine, et al.
Veröffentlicht: (2025)
von: Lbath, Amine, et al.
Veröffentlicht: (2025)
GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework
von: Sansford, Hannah, et al.
Veröffentlicht: (2024)
von: Sansford, Hannah, et al.
Veröffentlicht: (2024)
Open Your Eyes: Vision Enhances Message Passing Neural Networks in Link Prediction
von: Wei, Yanbin, et al.
Veröffentlicht: (2025)
von: Wei, Yanbin, et al.
Veröffentlicht: (2025)
Measuring all the noises of LLM Evals
von: Wang, Sida
Veröffentlicht: (2025)
von: Wang, Sida
Veröffentlicht: (2025)
TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents
von: Chen, Weiyi, et al.
Veröffentlicht: (2026)
von: Chen, Weiyi, et al.
Veröffentlicht: (2026)
Adaptive User Journeys in Pharma E-Commerce with Reinforcement Learning: Insights from SwipeRx
von: del Río, Ana Fernández, et al.
Veröffentlicht: (2024)
von: del Río, Ana Fernández, et al.
Veröffentlicht: (2024)
Evaluation and Benchmarking of LLM Agents: A Survey
von: Mohammadi, Mahmoud, et al.
Veröffentlicht: (2025)
von: Mohammadi, Mahmoud, et al.
Veröffentlicht: (2025)
The Evaluation Game: Beyond Static LLM Benchmarking
von: Wang, Paul, et al.
Veröffentlicht: (2026)
von: Wang, Paul, et al.
Veröffentlicht: (2026)
ZSC-Eval: An Evaluation Toolkit and Benchmark for Multi-agent Zero-shot Coordination
von: Wang, Xihuai, et al.
Veröffentlicht: (2023)
von: Wang, Xihuai, et al.
Veröffentlicht: (2023)
Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation
von: Rahman, Musfiqur, et al.
Veröffentlicht: (2025)
von: Rahman, Musfiqur, et al.
Veröffentlicht: (2025)
CausalMed: Causality-Based Personalized Medication Recommendation Centered on Patient health state
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
von: He, Yuanqin, et al.
Veröffentlicht: (2024)
von: He, Yuanqin, et al.
Veröffentlicht: (2024)
ProCause: Generating Counterfactual Outcomes to Evaluate Prescriptive Process Monitoring Methods
von: De Moor, Jakob, et al.
Veröffentlicht: (2025)
von: De Moor, Jakob, et al.
Veröffentlicht: (2025)
Benchmarking and Evaluation of AI Models in Biology: Outcomes and Recommendations from the CZI Virtual Cells Workshop
von: Fahsbender, Elizabeth, et al.
Veröffentlicht: (2025)
von: Fahsbender, Elizabeth, et al.
Veröffentlicht: (2025)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
von: Wang, Ganghua, et al.
Veröffentlicht: (2025)
von: Wang, Ganghua, et al.
Veröffentlicht: (2025)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
von: Yu, Longhui, et al.
Veröffentlicht: (2023)
von: Yu, Longhui, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
von: Chen, Shuhao, et al.
Veröffentlicht: (2024) -
Effective Structured Prompting by Meta-Learning and Representative Verbalizer
von: Jiang, Weisen, et al.
Veröffentlicht: (2023) -
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
von: Chen, Shuhao, et al.
Veröffentlicht: (2026) -
MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification
von: Jiang, Weisen, et al.
Veröffentlicht: (2026) -
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)