CPsyExam: A Chinese Benchmark for Evaluating Psychology using Examinations
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Jiahao, Zhu, Jingwei, Tan, Minghuan, Yang, Min, Li, Renhao, Yang, Di, Zhang, Chenhao, Ye, Guancheng, Li, Chengming, Hu, Xiping, Wong, Derek F. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling
by: Zhang, Chenhao, et al.
Published: (2024)
by: Zhang, Chenhao, et al.
Published: (2024)
CoEvol: Constructing Better Responses for Instruction Finetuning through Multi-Agent Cooperation
by: Li, Renhao, et al.
Published: (2024)
by: Li, Renhao, et al.
Published: (2024)
AutoCBT: An Autonomous Multi-agent Framework for Cognitive Behavioral Therapy in Psychological Counseling
by: Xu, Ancheng, et al.
Published: (2025)
by: Xu, Ancheng, et al.
Published: (2025)
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
by: Zhu, Jingwei, et al.
Published: (2024)
by: Zhu, Jingwei, et al.
Published: (2024)
APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
by: Hu, Yuxuan, et al.
Published: (2024)
by: Hu, Yuxuan, et al.
Published: (2024)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
Expression Syntax Information Bottleneck for Math Word Problems
by: Xiong, Jing, et al.
Published: (2023)
by: Xiong, Jing, et al.
Published: (2023)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024)
by: Hou, Jinchang, et al.
Published: (2024)
Training on the Benchmark Is Not All You Need
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
Layer-wise Regularized Dropout for Neural Language Models
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
Self-consistent Reasoning For Solving Math Word Problems
by: Xiong, Jing, et al.
Published: (2022)
by: Xiong, Jing, et al.
Published: (2022)
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
by: Hu, Yuxuan, et al.
Published: (2024)
by: Hu, Yuxuan, et al.
Published: (2024)
HiMATE: A Hierarchical Multi-Agent Framework for Machine Translation Evaluation
by: Zhang, Shijie, et al.
Published: (2025)
by: Zhang, Shijie, et al.
Published: (2025)
FedPall: Prototype-based Adversarial and Collaborative Learning for Federated Learning with Feature Drift
by: Zhang, Yong, et al.
Published: (2025)
by: Zhang, Yong, et al.
Published: (2025)
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
by: Ni, Shiwen, et al.
Published: (2023)
by: Ni, Shiwen, et al.
Published: (2023)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
by: Chen, Jian, et al.
Published: (2025)
by: Chen, Jian, et al.
Published: (2025)
Exploring the Impact of Personality Traits on LLM Bias and Toxicity
by: Wang, Shuo, et al.
Published: (2025)
by: Wang, Shuo, et al.
Published: (2025)
LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction
by: Liu, Weichu, et al.
Published: (2025)
by: Liu, Weichu, et al.
Published: (2025)
We Need Two Worlds'
by: Minghuan, Li
Published: (2010)
by: Minghuan, Li
Published: (2010)
MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning
by: Huang, Ruijun, et al.
Published: (2026)
by: Huang, Ruijun, et al.
Published: (2026)
Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry
by: Wang, Shanshan, et al.
Published: (2025)
by: Wang, Shanshan, et al.
Published: (2025)
Personalized Benchmarking: Evaluating LLMs by Individual Preferences
by: Garbacea, Cristina, et al.
Published: (2026)
by: Garbacea, Cristina, et al.
Published: (2026)
CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data
by: Zhang, Qian-Wen, et al.
Published: (2024)
by: Zhang, Qian-Wen, et al.
Published: (2024)
CLHA: A Simple yet Effective Contrastive Learning Framework for Human Alignment
by: Fang, Feiteng, et al.
Published: (2024)
by: Fang, Feiteng, et al.
Published: (2024)
RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
by: Zhao, Jiahao, et al.
Published: (2025)
by: Zhao, Jiahao, et al.
Published: (2025)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
by: Xu, Ancheng, et al.
Published: (2024)
by: Xu, Ancheng, et al.
Published: (2024)
DualCoTs: Dual Chain-of-Thoughts Prompting for Sentiment Lexicon Expansion of Idioms
by: Niu, Fuqiang, et al.
Published: (2024)
by: Niu, Fuqiang, et al.
Published: (2024)
Classroom Final Exam: An Instructor-Tested Reasoning Benchmark
by: Gao, Chongyang, et al.
Published: (2026)
by: Gao, Chongyang, et al.
Published: (2026)
LEXam: Benchmarking Legal Reasoning on 340 Law Exams
by: Fan, Yu, et al.
Published: (2025)
by: Fan, Yu, et al.
Published: (2025)
Lower Layers Matter: Alleviating Hallucination via Multi-Layer Fusion Contrastive Decoding with Truthfulness Refocused
by: Chen, Dingwei, et al.
Published: (2024)
by: Chen, Dingwei, et al.
Published: (2024)
HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation
by: Li, Mingxuan, et al.
Published: (2025)
by: Li, Mingxuan, et al.
Published: (2025)
Reasoning Before Diagnosis: Physician-Inspired Structured Thinking for ECG Classification
by: Wu, Yang, et al.
Published: (2026)
by: Wu, Yang, et al.
Published: (2026)
Human Footprint dataset for Sanjiangyuan Area of China
by: Tan, Linyi, et al.
Published: (2022)
by: Tan, Linyi, et al.
Published: (2022)
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025)
by: Li, Renhao, et al.
Published: (2025)
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
by: Liang, Jiashuo, et al.
Published: (2024)
by: Liang, Jiashuo, et al.
Published: (2024)
Towards Benchmarking and Evaluating Deepfake Detection
by: Lin, Chenhao, et al.
Published: (2022)
by: Lin, Chenhao, et al.
Published: (2022)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
by: Zhang, Hengxiang, et al.
Published: (2024)
by: Zhang, Hengxiang, et al.
Published: (2024)
Bayes Conditional Distribution Estimation for Knowledge Distillation Based on Conditional Mutual Information
by: Ye, Linfeng, et al.
Published: (2024)
by: Ye, Linfeng, et al.
Published: (2024)
SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels
by: Du, Guancheng, et al.
Published: (2025)
by: Du, Guancheng, et al.
Published: (2025)
Fine-Tuning and Deploying Large Language Models Over Edges: Issues and Approaches
by: Dong, Yanjie, et al.
Published: (2024)
by: Dong, Yanjie, et al.
Published: (2024)
Similar Items
-
CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling
by: Zhang, Chenhao, et al.
Published: (2024) -
CoEvol: Constructing Better Responses for Instruction Finetuning through Multi-Agent Cooperation
by: Li, Renhao, et al.
Published: (2024) -
AutoCBT: An Autonomous Multi-agent Framework for Cognitive Behavioral Therapy in Psychological Counseling
by: Xu, Ancheng, et al.
Published: (2025) -
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
by: Zhu, Jingwei, et al.
Published: (2024) -
APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
by: Hu, Yuxuan, et al.
Published: (2024)