TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yue, Wenjing, Wang, Xiaoling, Zhu, Wei, Guan, Ming, Zheng, Huanran, Wang, Pengfei, Sun, Changzhi, Ma, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
par: Yu, Ping, et autres
Publié: (2024)
par: Yu, Ping, et autres
Publié: (2024)
Qibo: A Large Language Model for Traditional Chinese Medicine
par: Zhang, Heyi, et autres
Publié: (2024)
par: Zhang, Heyi, et autres
Publié: (2024)
BianCang: A Traditional Chinese Medicine Large Language Model
par: Wei, Sibo, et autres
Publié: (2024)
par: Wei, Sibo, et autres
Publié: (2024)
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
par: Huang, Tianai, et autres
Publié: (2025)
par: Huang, Tianai, et autres
Publié: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
par: Nie, Ying, et autres
Publié: (2024)
par: Nie, Ying, et autres
Publié: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
par: Yan, Lian, et autres
Publié: (2025)
par: Yan, Lian, et autres
Publié: (2025)
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
par: Cheng, Zihao, et autres
Publié: (2025)
par: Cheng, Zihao, et autres
Publié: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
par: Kong, Shufeng, et autres
Publié: (2025)
par: Kong, Shufeng, et autres
Publié: (2025)
Exploring the Comprehension of ChatGPT in Traditional Chinese Medicine Knowledge
par: Yizhen, Li, et autres
Publié: (2024)
par: Yizhen, Li, et autres
Publié: (2024)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
par: Zhang, Min, et autres
Publié: (2025)
par: Zhang, Min, et autres
Publié: (2025)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
par: Chen, Shisong, et autres
Publié: (2025)
par: Chen, Shisong, et autres
Publié: (2025)
Intelligent Understanding of Large Language Models in Traditional Chinese Medicine Based on Prompt Engineering Framework
par: Chen, Yirui, et autres
Publié: (2024)
par: Chen, Yirui, et autres
Publié: (2024)
TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine
par: Huang, Tianai, et autres
Publié: (2025)
par: Huang, Tianai, et autres
Publié: (2025)
TS-HTFA: Advancing Time Series Forecasting via Hierarchical Text-Free Alignment with Large Language Models
par: Wang, Pengfei, et autres
Publié: (2024)
par: Wang, Pengfei, et autres
Publié: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Generation with Dynamic Vocabulary
par: Liu, Yanting, et autres
Publié: (2024)
par: Liu, Yanting, et autres
Publié: (2024)
Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation
par: Luo, Wenzhen, et autres
Publié: (2025)
par: Luo, Wenzhen, et autres
Publié: (2025)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
par: Yin, Ji, et autres
Publié: (2025)
par: Yin, Ji, et autres
Publié: (2025)
A Comprehensive Evaluation of Large Language Models on Aspect-Based Sentiment Analysis
par: Zhou, Changzhi, et autres
Publié: (2024)
par: Zhou, Changzhi, et autres
Publié: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
par: Hou, Jinchang, et autres
Publié: (2024)
par: Hou, Jinchang, et autres
Publié: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
BenCao: An Instruction-Tuned Large Language Model for Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan
par: Yao, Jui-Ming, et autres
Publié: (2025)
par: Yao, Jui-Ming, et autres
Publié: (2025)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
par: Lyu, Hanjia, et autres
Publié: (2025)
par: Lyu, Hanjia, et autres
Publié: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
par: He, Yancheng, et autres
Publié: (2024)
par: He, Yancheng, et autres
Publié: (2024)
MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuning
par: Zhang, Jingfan, et autres
Publié: (2024)
par: Zhang, Jingfan, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
par: Zhang, Qian, et autres
Publié: (2024)
par: Zhang, Qian, et autres
Publié: (2024)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2025)
par: Wang, Zekun, et autres
Publié: (2025)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
par: Zhang, Wenjing, et autres
Publié: (2024)
par: Zhang, Wenjing, et autres
Publié: (2024)
A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
par: Xiao, Hanguang, et autres
Publié: (2024)
par: Xiao, Hanguang, et autres
Publié: (2024)
Documents similaires
-
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
par: Yu, Ping, et autres
Publié: (2024) -
Qibo: A Large Language Model for Traditional Chinese Medicine
par: Zhang, Heyi, et autres
Publié: (2024) -
BianCang: A Traditional Chinese Medicine Large Language Model
par: Wei, Sibo, et autres
Publié: (2024) -
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
par: Huang, Tianai, et autres
Publié: (2025) -
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
par: Nie, Ying, et autres
Publié: (2024)