EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yuyan, Wang, Hao, Yan, Songzhou, Liu, Sijia, Li, Yueze, Zhao, Yi, Xiao, Yanghua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Recent Advancement of Emotion Cognition in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Why Did Apple Fall: Evaluating Curiosity in Large Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
XMeCap: Meme Caption Generation with Sub-Image Adaptability
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Can Pre-trained Language Models Understand Chinese Humor?
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
MAPO: Boosting Large Language Model Performance with Model-Adaptive Prompt Optimization
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
par: Gu, Zhouhong, et autres
Publié: (2024)
par: Gu, Zhouhong, et autres
Publié: (2024)
SED: Self-Evaluation Decoding Enhances Large Language Models for Better Generation
par: Luo, Ziqin, et autres
Publié: (2024)
par: Luo, Ziqin, et autres
Publié: (2024)
Toward Adaptive Reasoning in Large Language Models with Thought Rollback
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
par: Zhang, Xiaotian, et autres
Publié: (2023)
par: Zhang, Xiaotian, et autres
Publié: (2023)
iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning
par: Chen, Sijia, et autres
Publié: (2025)
par: Chen, Sijia, et autres
Publié: (2025)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
par: Sabour, Sahand, et autres
Publié: (2024)
par: Sabour, Sahand, et autres
Publié: (2024)
Chain-of-Knowledge: Integrating Knowledge Reasoning into Large Language Models by Learning from Knowledge Graphs
par: Zhang, Yifei, et autres
Publié: (2024)
par: Zhang, Yifei, et autres
Publié: (2024)
QUILL: Quotation Generation Enhancement of Large Language Models
par: Xiao, Jin, et autres
Publié: (2024)
par: Xiao, Jin, et autres
Publié: (2024)
Past Meets Present: Creating Historical Analogy with Large Language Models
par: Li, Nianqi, et autres
Publié: (2024)
par: Li, Nianqi, et autres
Publié: (2024)
Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems
par: Cui, Tianyu, et autres
Publié: (2024)
par: Cui, Tianyu, et autres
Publié: (2024)
A Survey on Collaborative Mechanisms Between Large and Small Language Models
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Empathy by Design: Aligning Large Language Models for Healthcare Dialogue
par: Umucu, Emre, et autres
Publié: (2025)
par: Umucu, Emre, et autres
Publié: (2025)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
H2HTalk: Evaluating Large Language Models as Emotional Companion
par: Wang, Boyang, et autres
Publié: (2025)
par: Wang, Boyang, et autres
Publié: (2025)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
par: Li, Zheqing, et autres
Publié: (2025)
par: Li, Zheqing, et autres
Publié: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
par: Sun, Haochen, et autres
Publié: (2025)
par: Sun, Haochen, et autres
Publié: (2025)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
par: Wu, Jialiang, et autres
Publié: (2025)
par: Wu, Jialiang, et autres
Publié: (2025)
HOTVCOM: Generating Buzzworthy Comments for Videos
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
CEM: A Data-Efficient Method for Large Language Models to Continue Evolving From Mistakes
par: Zhao, Haokun, et autres
Publié: (2024)
par: Zhao, Haokun, et autres
Publié: (2024)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
par: Li, Yanda, et autres
Publié: (2024)
par: Li, Yanda, et autres
Publié: (2024)
Enhancing Quantitative Reasoning Skills of Large Language Models through Dimension Perception
par: Huang, Yuncheng, et autres
Publié: (2023)
par: Huang, Yuncheng, et autres
Publié: (2023)
Think Thrice Before You Act: Progressive Thought Refinement in Large Language Models
par: Du, Chengyu, et autres
Publié: (2024)
par: Du, Chengyu, et autres
Publié: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
par: Hu, He, et autres
Publié: (2025)
par: Hu, He, et autres
Publié: (2025)
Assessing Empathy in Large Language Models with Real-World Physician-Patient Interactions
par: Luo, Man, et autres
Publié: (2024)
par: Luo, Man, et autres
Publié: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
par: Li, Ce, et autres
Publié: (2025)
par: Li, Ce, et autres
Publié: (2025)
Large Language Model Benchmarks in Medical Tasks
par: Yan, Lawrence K. Q., et autres
Publié: (2024)
par: Yan, Lawrence K. Q., et autres
Publié: (2024)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Documents similaires
-
Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?
par: Chen, Yuyan, et autres
Publié: (2024) -
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024) -
Recent Advancement of Emotion Cognition in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024) -
Why Did Apple Fall: Evaluating Curiosity in Large Language Models
par: Wang, Haoyu, et autres
Publié: (2025) -
XMeCap: Meme Caption Generation with Sub-Image Adaptability
par: Chen, Yuyan, et autres
Publié: (2024)