MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
Fuente:
arXiv
Saved in:
| Main Authors: | Jin, Haoan, Shi, Jiacheng, Xu, Hanhui, Zhu, Kenny Q., Wu, Mengyue |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2026)
by: Jin, Haoan, et al.
Published: (2026)
Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics
by: Xu, Hanhui, et al.
Published: (2026)
by: Xu, Hanhui, et al.
Published: (2026)
PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models
by: Jin, Haoan, et al.
Published: (2023)
by: Jin, Haoan, et al.
Published: (2023)
Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking
by: Huang, Chutian, et al.
Published: (2026)
by: Huang, Chutian, et al.
Published: (2026)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
by: Wei, Jianhui, et al.
Published: (2025)
by: Wei, Jianhui, et al.
Published: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
by: Song, Xiujie, et al.
Published: (2024)
by: Song, Xiujie, et al.
Published: (2024)
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
by: Shen, Yaling, et al.
Published: (2026)
by: Shen, Yaling, et al.
Published: (2026)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
by: Zhang, Xiechi, et al.
Published: (2025)
by: Zhang, Xiechi, et al.
Published: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
MedGo: A Chinese Medical Large Language Model
by: Zhang, Haitao, et al.
Published: (2024)
by: Zhang, Haitao, et al.
Published: (2024)
CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models
by: Shi, Haoxiang, et al.
Published: (2024)
by: Shi, Haoxiang, et al.
Published: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
by: Shi, Ling, et al.
Published: (2024)
by: Shi, Ling, et al.
Published: (2024)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024)
by: Ouyang, Zetian, et al.
Published: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
by: Ma, Guoqing, et al.
Published: (2025)
by: Ma, Guoqing, et al.
Published: (2025)
MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings
by: Corbeil, Jean-Philippe, et al.
Published: (2025)
by: Corbeil, Jean-Philippe, et al.
Published: (2025)
Modeling Emotions and Ethics with Large Language Models
by: Chang, Edward Y.
Published: (2024)
by: Chang, Edward Y.
Published: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026)
by: Liu, Junyu, et al.
Published: (2026)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
by: Yu, Linhao, et al.
Published: (2024)
by: Yu, Linhao, et al.
Published: (2024)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
by: Özen, Yıldırım, et al.
Published: (2025)
by: Özen, Yıldırım, et al.
Published: (2025)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgment
by: Li, Ruochen, et al.
Published: (2025)
by: Li, Ruochen, et al.
Published: (2025)
ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
by: Tian, Yuanhe, et al.
Published: (2025)
by: Tian, Yuanhe, et al.
Published: (2025)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
by: Qiu, Zexuan, et al.
Published: (2024)
by: Qiu, Zexuan, et al.
Published: (2024)
Ethics Whitepaper: Whitepaper on Ethical Research into Large Language Models
by: Ungless, Eddie L., et al.
Published: (2024)
by: Ungless, Eddie L., et al.
Published: (2024)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
by: Li, Xingyuan, et al.
Published: (2024)
by: Li, Xingyuan, et al.
Published: (2024)
EMO: Earth Mover Distance Optimization for Auto-Regressive Language Modeling
by: Ren, Siyu, et al.
Published: (2023)
by: Ren, Siyu, et al.
Published: (2023)
Evaluation Ethics of LLMs in Legal Domain
by: Zhang, Ruizhe, et al.
Published: (2024)
by: Zhang, Ruizhe, et al.
Published: (2024)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
by: Bedi, Suhana, et al.
Published: (2025)
by: Bedi, Suhana, et al.
Published: (2025)
Development of Application-Specific Large Language Models to Facilitate Research Ethics Review
by: Mann, Sebastian Porsdam, et al.
Published: (2025)
by: Mann, Sebastian Porsdam, et al.
Published: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025)
by: He, Jiayi, et al.
Published: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
by: Shi, Wenqi, et al.
Published: (2024)
by: Shi, Wenqi, et al.
Published: (2024)
Mixed Chain-of-Psychotherapies for Emotional Support Chatbot
by: Chen, Siyuan, et al.
Published: (2024)
by: Chen, Siyuan, et al.
Published: (2024)
Is Your Image a Good Storyteller?
by: Song, Xiujie, et al.
Published: (2024)
by: Song, Xiujie, et al.
Published: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
by: Zhou, Jinfeng, et al.
Published: (2025)
by: Zhou, Jinfeng, et al.
Published: (2025)
Depression Diagnosis Dialogue Simulation: Self-improving Psychiatrist with Tertiary Memory
by: Lan, Kunyao, et al.
Published: (2024)
by: Lan, Kunyao, et al.
Published: (2024)
On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference
by: Ren, Siyu, et al.
Published: (2024)
by: Ren, Siyu, et al.
Published: (2024)
Similar Items
-
A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2026) -
Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics
by: Xu, Hanhui, et al.
Published: (2026) -
PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models
by: Jin, Haoan, et al.
Published: (2023) -
Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking
by: Huang, Chutian, et al.
Published: (2026) -
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
by: Wei, Jianhui, et al.
Published: (2025)