TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Zixin, Wang, Ziteng, Fan, Haotian, Zhang, Xinjie, Wang, Wenxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023)
di: Chu, Zheng, et al.
Pubblicazione: (2023)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
di: Wang, Boxin, et al.
Pubblicazione: (2023)
di: Wang, Boxin, et al.
Pubblicazione: (2023)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
di: Wang, Wenxuan
Pubblicazione: (2024)
di: Wang, Wenxuan
Pubblicazione: (2024)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
di: Liu, Shuyi, et al.
Pubblicazione: (2025)
di: Liu, Shuyi, et al.
Pubblicazione: (2025)
EthicsMH: A Pilot Benchmark for Ethical Reasoning in Mental Health AI
di: Kasu, Sai Kartheek Reddy
Pubblicazione: (2025)
di: Kasu, Sai Kartheek Reddy
Pubblicazione: (2025)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
di: Aljohani, Manar, et al.
Pubblicazione: (2025)
di: Aljohani, Manar, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systems
di: Zhang, Xinjie, et al.
Pubblicazione: (2025)
di: Zhang, Xinjie, et al.
Pubblicazione: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
di: Lai, Peichao, et al.
Pubblicazione: (2025)
di: Lai, Peichao, et al.
Pubblicazione: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
di: LI, Yizhi, et al.
Pubblicazione: (2024)
di: LI, Yizhi, et al.
Pubblicazione: (2024)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
di: Wang, Shouju, et al.
Pubblicazione: (2026)
di: Wang, Shouju, et al.
Pubblicazione: (2026)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
di: Yu, Yongan, et al.
Pubblicazione: (2025)
di: Yu, Yongan, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
di: Jin, Renren, et al.
Pubblicazione: (2024)
di: Jin, Renren, et al.
Pubblicazione: (2024)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models
di: Yeo, Gerard, et al.
Pubblicazione: (2025)
di: Yeo, Gerard, et al.
Pubblicazione: (2025)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation of Large Language Models on Mental Illnesses in Arabic Context
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
di: Wang, Zhensheng, et al.
Pubblicazione: (2026)
di: Wang, Zhensheng, et al.
Pubblicazione: (2026)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis
di: Hengle, Amey, et al.
Pubblicazione: (2024)
di: Hengle, Amey, et al.
Pubblicazione: (2024)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
DebugBench: Evaluating Debugging Capability of Large Language Models
di: Tian, Runchu, et al.
Pubblicazione: (2024)
di: Tian, Runchu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025) -
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023) -
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026) -
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024) -
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
di: Li, Kai, et al.
Pubblicazione: (2025)