RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Jiahao, Xu, Luxin, Tan, Minghuan, Zhang, Lichao, Argha, Ahmadreza, Alinejad-Rokny, Hamid, Yang, Min |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
by: Zhu, Jingwei, et al.
Published: (2024)
by: Zhu, Jingwei, et al.
Published: (2024)
Interpretable graph-based models on multimodal biomedical data integration: A technical review and benchmarking
by: Sadeghi, Alireza, et al.
Published: (2025)
by: Sadeghi, Alireza, et al.
Published: (2025)
ETAGE: Enhanced Test Time Adaptation with Integrated Entropy and Gradient Norms for Robust Model Performance
by: Shamsi, Afshar, et al.
Published: (2024)
by: Shamsi, Afshar, et al.
Published: (2024)
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
by: Chen, Dingwei, et al.
Published: (2025)
by: Chen, Dingwei, et al.
Published: (2025)
CLinNET: An Interpretable and Uncertainty‐Aware Deep Learning Framework for Multi‐Modal Clinical Genomics
by: Ivan Bakhshayeshi, et al.
Published: (2026)
by: Ivan Bakhshayeshi, et al.
Published: (2026)
SemanticST: Spatially Informed Semantic Graph Learning for Clustering, Integration, and Scalable Analysis of Spatial Transcriptomics
by: Zahedi, Roxana, et al.
Published: (2025)
by: Zahedi, Roxana, et al.
Published: (2025)
Lower Layers Matter: Alleviating Hallucination via Multi-Layer Fusion Contrastive Decoding with Truthfulness Refocused
by: Chen, Dingwei, et al.
Published: (2024)
by: Chen, Dingwei, et al.
Published: (2024)
STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generation
by: Li, Jiaming, et al.
Published: (2025)
by: Li, Jiaming, et al.
Published: (2025)
Structuring Reasoning for Complex Rules Beyond Flat Representations
by: Yang, Zhihao, et al.
Published: (2025)
by: Yang, Zhihao, et al.
Published: (2025)
xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
Small Language Model as Data Prospector for Large Language Model
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
PLOT: Enhancing Preference Learning via Optimal Transport
by: Zhu, Liang, et al.
Published: (2026)
by: Zhu, Liang, et al.
Published: (2026)
SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
by: Zhao, Jiahao, et al.
Published: (2026)
by: Zhao, Jiahao, et al.
Published: (2026)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
by: Wang, Qiyao, et al.
Published: (2026)
by: Wang, Qiyao, et al.
Published: (2026)
Transcriptomic Models for Immunotherapy Response Prediction Show Limited Cross-cohort Generalisability
by: Liang, Yuheng, et al.
Published: (2026)
by: Liang, Yuheng, et al.
Published: (2026)
How chromatin interactions shed light on interpreting non-coding genomic variants: opportunities and future direc-tions
by: Liang, Yuheng, et al.
Published: (2024)
by: Liang, Yuheng, et al.
Published: (2024)
Advancing Medical Image Segmentation with Mini-Net: A Lightweight Solution Tailored for Efficient Segmentation of Medical Images
by: Javed, Syed, et al.
Published: (2024)
by: Javed, Syed, et al.
Published: (2024)
Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates
by: Li, Shuaimin, et al.
Published: (2025)
by: Li, Shuaimin, et al.
Published: (2025)
Enhancing Monte Carlo Dropout Performance for Uncertainty Quantification
by: Asgharnezhad, Hamzeh, et al.
Published: (2025)
by: Asgharnezhad, Hamzeh, et al.
Published: (2025)
Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation
by: Safdar, Moin, et al.
Published: (2025)
by: Safdar, Moin, et al.
Published: (2025)
PersonaMath: Boosting Mathematical Reasoning via Persona-Driven Data Augmentation
by: Luo, Jing, et al.
Published: (2024)
by: Luo, Jing, et al.
Published: (2024)
EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection
by: Xu, Ancheng, et al.
Published: (2025)
by: Xu, Ancheng, et al.
Published: (2025)
SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation
by: Wang, Xinyu, et al.
Published: (2026)
by: Wang, Xinyu, et al.
Published: (2026)
PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination
by: Wang, Qiyao, et al.
Published: (2026)
by: Wang, Qiyao, et al.
Published: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
by: Xu, Ancheng, et al.
Published: (2024)
by: Xu, Ancheng, et al.
Published: (2024)
MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning
by: Huang, Ruijun, et al.
Published: (2026)
by: Huang, Ruijun, et al.
Published: (2026)
Beyond Quantity: Trajectory Diversity Scaling for Code Agents
by: Chen, Guhong, et al.
Published: (2026)
by: Chen, Guhong, et al.
Published: (2026)
AgentCourt: Simulating Court with Adversarial Evolvable Lawyer Agents
by: Chen, Guhong, et al.
Published: (2024)
by: Chen, Guhong, et al.
Published: (2024)
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
by: Chen, Yukun, et al.
Published: (2026)
by: Chen, Yukun, et al.
Published: (2026)
Quantification of Large Language Model Distillation
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
by: Han, Tessa, et al.
Published: (2024)
by: Han, Tessa, et al.
Published: (2024)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
by: Ying, Zonghao, et al.
Published: (2024)
by: Ying, Zonghao, et al.
Published: (2024)
PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations
by: Zolfaghari, Vahideh
Published: (2025)
by: Zolfaghari, Vahideh
Published: (2025)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
by: Qiao, Chuhan, et al.
Published: (2026)
by: Qiao, Chuhan, et al.
Published: (2026)
A Diagnostic Model for Acute Lymphoblastic Leukemia Using Metaheuristics and Deep Learning Methods
by: Rahmani, Amir Masoud, et al.
Published: (2024)
by: Rahmani, Amir Masoud, et al.
Published: (2024)
Training Superior Sparse Autoencoders for Instruct Models
by: Li, Jiaming, et al.
Published: (2025)
by: Li, Jiaming, et al.
Published: (2025)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
by: Wang, Qiyao, et al.
Published: (2026)
by: Wang, Qiyao, et al.
Published: (2026)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
by: Chen, Longze, et al.
Published: (2025)
by: Chen, Longze, et al.
Published: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025)
by: Li, Renhao, et al.
Published: (2025)
EMRModel: A Large Language Model for Extracting Medical Consultation Dialogues into Structured Medical Records
by: Zhao, Shuguang, et al.
Published: (2025)
by: Zhao, Shuguang, et al.
Published: (2025)
Similar Items
-
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
by: Zhu, Jingwei, et al.
Published: (2024) -
Interpretable graph-based models on multimodal biomedical data integration: A technical review and benchmarking
by: Sadeghi, Alireza, et al.
Published: (2025) -
ETAGE: Enhanced Test Time Adaptation with Integrated Entropy and Gradient Norms for Robust Model Performance
by: Shamsi, Afshar, et al.
Published: (2024) -
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
by: Chen, Dingwei, et al.
Published: (2025) -
CLinNET: An Interpretable and Uncertainty‐Aware Deep Learning Framework for Multi‐Modal Clinical Genomics
by: Ivan Bakhshayeshi, et al.
Published: (2026)