PsychBench: A comprehensive and professional benchmark for evaluating the performance of LLM-assisted psychiatric clinical practice
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shuyu, Wang, Ruoxi, Zhang, Ling, Zhu, Xuequan, Yang, Rui, Zhou, Xinzhu, Wu, Fei, Yang, Zhi, Jin, Cheng, Wang, Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PsychBench: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations
di: Keough, Patrick
Pubblicazione: (2026)
di: Keough, Patrick
Pubblicazione: (2026)
PathBench: A comprehensive comparison benchmark for pathology foundation models towards precision oncology
di: Ma, Jiabo, et al.
Pubblicazione: (2025)
di: Ma, Jiabo, et al.
Pubblicazione: (2025)
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
di: Shen, Yaling, et al.
Pubblicazione: (2026)
di: Shen, Yaling, et al.
Pubblicazione: (2026)
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
di: Zeng, Min
Pubblicazione: (2025)
di: Zeng, Min
Pubblicazione: (2025)
MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation
di: Yang, Junjie, et al.
Pubblicazione: (2025)
di: Yang, Junjie, et al.
Pubblicazione: (2025)
CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance
di: Zhang, Feng, et al.
Pubblicazione: (2025)
di: Zhang, Feng, et al.
Pubblicazione: (2025)
LLMzSzŁ: a comprehensive LLM benchmark for Polish
di: Jassem, Krzysztof, et al.
Pubblicazione: (2025)
di: Jassem, Krzysztof, et al.
Pubblicazione: (2025)
LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
Examining the robustness of LLM evaluation to the distributional assumptions of benchmarks
di: Ailem, Melissa, et al.
Pubblicazione: (2024)
di: Ailem, Melissa, et al.
Pubblicazione: (2024)
PostRainBench: A comprehensive benchmark and a new model for precipitation forecasting
di: Tang, Yujin, et al.
Pubblicazione: (2023)
di: Tang, Yujin, et al.
Pubblicazione: (2023)
Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
di: Dai, Chongyuan, et al.
Pubblicazione: (2025)
di: Dai, Chongyuan, et al.
Pubblicazione: (2025)
ECom-Bench: Can LLM Agent Resolve Real-World E-commerce Customer Support Issues?
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
A comprehensive survey of oracle character recognition: challenges, benchmarks, and beyond
di: Li, Jing, et al.
Pubblicazione: (2024)
di: Li, Jing, et al.
Pubblicazione: (2024)
PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments
di: Chen, Zhuang, et al.
Pubblicazione: (2026)
di: Chen, Zhuang, et al.
Pubblicazione: (2026)
PsychAdapter: Adapting LLM Transformers to Reflect Traits, Personality and Mental Health
di: Vu, Huy, et al.
Pubblicazione: (2024)
di: Vu, Huy, et al.
Pubblicazione: (2024)
Rethinking Abdominal Organ Segmentation (RAOS) in the clinical scenario: A robustness evaluation benchmark with challenging cases
di: Luo, Xiangde, et al.
Pubblicazione: (2024)
di: Luo, Xiangde, et al.
Pubblicazione: (2024)
NILC: Discovering New Intents with LLM-assisted Clustering
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models
di: Bandooni, Ashutosh, et al.
Pubblicazione: (2025)
di: Bandooni, Ashutosh, et al.
Pubblicazione: (2025)
PatchBoard: Schema-Grounded State Mutation for Reliable and Auditable LLM Multi-Agent Collaboration
di: Zhang, Shuyu, et al.
Pubblicazione: (2026)
di: Zhang, Shuyu, et al.
Pubblicazione: (2026)
A Divide-and-Conquer Approach for Global Orientation of Non-Watertight Scene-Level Point Clouds Using 0-1 Integer Optimization
di: Li, Zhuodong, et al.
Pubblicazione: (2025)
di: Li, Zhuodong, et al.
Pubblicazione: (2025)
The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
di: Canale, Giuseppe, et al.
Pubblicazione: (2025)
di: Canale, Giuseppe, et al.
Pubblicazione: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Adversarial Attacks on Both Face Recognition and Face Anti-spoofing Models
di: Zhou, Fengfan, et al.
Pubblicazione: (2024)
di: Zhou, Fengfan, et al.
Pubblicazione: (2024)
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
di: Yang, Shu, et al.
Pubblicazione: (2026)
di: Yang, Shu, et al.
Pubblicazione: (2026)
Machine-assisted writing evaluation: Exploring pre-trained language models in analyzing argumentative moves
di: Qin, Wenjuan, et al.
Pubblicazione: (2025)
di: Qin, Wenjuan, et al.
Pubblicazione: (2025)
DevBench: A multimodal developmental benchmark for language learning
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2024)
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2024)
Development and large-scale benchmarks of a protein--ligand absolute binding free energy toolkit
di: Liu, Yu, et al.
Pubblicazione: (2026)
di: Liu, Yu, et al.
Pubblicazione: (2026)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
GraphBench: Next-generation graph learning benchmarking
di: Stoll, Timo, et al.
Pubblicazione: (2025)
di: Stoll, Timo, et al.
Pubblicazione: (2025)
MIRAGE: Multimodal foundation model and benchmark for comprehensive retinal OCT image analysis
di: Morano, José, et al.
Pubblicazione: (2025)
di: Morano, José, et al.
Pubblicazione: (2025)
Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation
di: Liu, Xiaohong, et al.
Pubblicazione: (2024)
di: Liu, Xiaohong, et al.
Pubblicazione: (2024)
Qualitative Study for LLM-assisted Design Study Process: Strategies, Challenges, and Roles
di: Ruan, Shaolun, et al.
Pubblicazione: (2025)
di: Ruan, Shaolun, et al.
Pubblicazione: (2025)
Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark
di: Wu, Jian, et al.
Pubblicazione: (2024)
di: Wu, Jian, et al.
Pubblicazione: (2024)
Xmodel-1.5: An 1B-scale Multilingual LLM
di: Qun, Wang, et al.
Pubblicazione: (2024)
di: Qun, Wang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PsychBench: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations
di: Keough, Patrick
Pubblicazione: (2026) -
PathBench: A comprehensive comparison benchmark for pathology foundation models towards precision oncology
di: Ma, Jiabo, et al.
Pubblicazione: (2025) -
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
di: Shen, Yaling, et al.
Pubblicazione: (2026) -
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
di: Zeng, Min
Pubblicazione: (2025) -
MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation
di: Yang, Junjie, et al.
Pubblicazione: (2025)