TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Tianai, Lu, Lu, Chen, Jiayuan, Liu, Lihao, He, Junjun, Zhao, Yuping, Tang, Wenchao, Xu, Jie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
von: Huang, Tianai, et al.
Veröffentlicht: (2025)
von: Huang, Tianai, et al.
Veröffentlicht: (2025)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
von: Jiang, Luyi, et al.
Veröffentlicht: (2025)
von: Jiang, Luyi, et al.
Veröffentlicht: (2025)
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
von: Cheng, Zihao, et al.
Veröffentlicht: (2025)
von: Cheng, Zihao, et al.
Veröffentlicht: (2025)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
von: Yu, Ping, et al.
Veröffentlicht: (2024)
von: Yu, Ping, et al.
Veröffentlicht: (2024)
A Novel Ophthalmic Benchmark for Evaluating Multimodal Large Language Models with Fundus Photographs and OCT Images
von: Liang, Xiaoyi, et al.
Veröffentlicht: (2025)
von: Liang, Xiaoyi, et al.
Veröffentlicht: (2025)
TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought
von: Li, Jianmin, et al.
Veröffentlicht: (2026)
von: Li, Jianmin, et al.
Veröffentlicht: (2026)
BenCao: An Instruction-Tuned Large Language Model for Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
BianCang: A Traditional Chinese Medicine Large Language Model
von: Wei, Sibo, et al.
Veröffentlicht: (2024)
von: Wei, Sibo, et al.
Veröffentlicht: (2024)
Qibo: A Large Language Model for Traditional Chinese Medicine
von: Zhang, Heyi, et al.
Veröffentlicht: (2024)
von: Zhang, Heyi, et al.
Veröffentlicht: (2024)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
CEval: A Benchmark for Evaluating Counterfactual Text Generation
von: Nguyen, Van Bach, et al.
Veröffentlicht: (2024)
von: Nguyen, Van Bach, et al.
Veröffentlicht: (2024)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
von: Yin, Ji, et al.
Veröffentlicht: (2025)
von: Yin, Ji, et al.
Veröffentlicht: (2025)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
From Metaphor to Mechanism: How LLMs Decode Traditional Chinese Medicine Symbolic Language for Modern Clinical Relevance
von: Tang, Jiacheng, et al.
Veröffentlicht: (2025)
von: Tang, Jiacheng, et al.
Veröffentlicht: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
von: Li, Yang, et al.
Veröffentlicht: (2026)
von: Li, Yang, et al.
Veröffentlicht: (2026)
Enhancing the Traditional Chinese Medicine Capabilities of Large Language Model through Reinforcement Learning from AI Feedback
von: Yu, Song, et al.
Veröffentlicht: (2024)
von: Yu, Song, et al.
Veröffentlicht: (2024)
MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps
von: Zhou, Xiongtao, et al.
Veröffentlicht: (2024)
von: Zhou, Xiongtao, et al.
Veröffentlicht: (2024)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
von: Fu, Yicheng, et al.
Veröffentlicht: (2025)
von: Fu, Yicheng, et al.
Veröffentlicht: (2025)
Intelligent Understanding of Large Language Models in Traditional Chinese Medicine Based on Prompt Engineering Framework
von: Chen, Yirui, et al.
Veröffentlicht: (2024)
von: Chen, Yirui, et al.
Veröffentlicht: (2024)
Exploring the Comprehension of ChatGPT in Traditional Chinese Medicine Knowledge
von: Yizhen, Li, et al.
Veröffentlicht: (2024)
von: Yizhen, Li, et al.
Veröffentlicht: (2024)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
von: Lyu, Hanjia, et al.
Veröffentlicht: (2025)
von: Lyu, Hanjia, et al.
Veröffentlicht: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
von: Kong, Shufeng, et al.
Veröffentlicht: (2025)
von: Kong, Shufeng, et al.
Veröffentlicht: (2025)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
von: Tam, Zhi Rui, et al.
Veröffentlicht: (2025)
von: Tam, Zhi Rui, et al.
Veröffentlicht: (2025)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
von: Ding, Jinru, et al.
Veröffentlicht: (2025)
von: Ding, Jinru, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
Utilizing Large Language Models for Named Entity Recognition in Traditional Chinese Medicine against COVID-19 Literature: Comparative Study
von: Tong, Xu, et al.
Veröffentlicht: (2024)
von: Tong, Xu, et al.
Veröffentlicht: (2024)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
von: Zhou, Hongli, et al.
Veröffentlicht: (2025)
von: Zhou, Hongli, et al.
Veröffentlicht: (2025)
Evaluating Chinese Ambiguity Understanding in Large Language Models
von: Mo, Junwen, et al.
Veröffentlicht: (2026)
von: Mo, Junwen, et al.
Veröffentlicht: (2026)
TCM-FTP: Fine-Tuning Large Language Models for Herbal Prescription Prediction
von: Zhou, Xingzhi, et al.
Veröffentlicht: (2024)
von: Zhou, Xingzhi, et al.
Veröffentlicht: (2024)
OpenTCM: A GraphRAG-Empowered LLM-based System for Traditional Chinese Medicine Knowledge Retrieval and Diagnosis
von: He, Jinglin, et al.
Veröffentlicht: (2025)
von: He, Jinglin, et al.
Veröffentlicht: (2025)
Traditional Chinese Medicine Case Analysis System for High-Level Semantic Abstraction: Optimized with Prompt and RAG
von: Xu, Peng, et al.
Veröffentlicht: (2024)
von: Xu, Peng, et al.
Veröffentlicht: (2024)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
von: Liang, Xun, et al.
Veröffentlicht: (2023)
von: Liang, Xun, et al.
Veröffentlicht: (2023)
Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine
von: Liu, Yishen, et al.
Veröffentlicht: (2025)
von: Liu, Yishen, et al.
Veröffentlicht: (2025)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
von: Xu, Xinzhe, et al.
Veröffentlicht: (2025)
von: Xu, Xinzhe, et al.
Veröffentlicht: (2025)
The Evolving Landscape of Generative Large Language Models and Traditional Natural Language Processing in Medicine
von: Yang, Rui, et al.
Veröffentlicht: (2025)
von: Yang, Rui, et al.
Veröffentlicht: (2025)
Tianyi: A Traditional Chinese Medicine all-rounder language model and its Real-World Clinical Practice
von: Liu, Zhi, et al.
Veröffentlicht: (2025)
von: Liu, Zhi, et al.
Veröffentlicht: (2025)
MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
von: Cai, Yida, et al.
Veröffentlicht: (2024)
von: Cai, Yida, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
von: Huang, Tianai, et al.
Veröffentlicht: (2025) -
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025) -
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
von: Jiang, Luyi, et al.
Veröffentlicht: (2025) -
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
von: Cheng, Zihao, et al.
Veröffentlicht: (2025) -
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
von: Yu, Ping, et al.
Veröffentlicht: (2024)