HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Iyer, Laya, Aggarwal, Kriti, Koyejo, Sanmi, Heyman, Gail, Ong, Desmond C., Mukherjee, Subhabrata |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
par: Iyer, Laya, et autres
Publié: (2026)
par: Iyer, Laya, et autres
Publié: (2026)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
par: Tanmay, Kumar, et autres
Publié: (2025)
par: Tanmay, Kumar, et autres
Publié: (2025)
Logits are All We Need to Adapt Closed Models
par: Hiranandani, Gaurush, et autres
Publié: (2025)
par: Hiranandani, Gaurush, et autres
Publié: (2025)
The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior
par: Wang, Angelina, et autres
Publié: (2025)
par: Wang, Angelina, et autres
Publié: (2025)
Lottery Ticket Adaptation: Mitigating Destructive Interference in LLMs
par: Panda, Ashwinee, et autres
Publié: (2024)
par: Panda, Ashwinee, et autres
Publié: (2024)
Discourse Diversity in Multi-Turn Empathic Dialogue
par: Zhan, Hongli, et autres
Publié: (2026)
par: Zhan, Hongli, et autres
Publié: (2026)
Emotional Support with LLM-based Empathetic Dialogue Generation
par: Wang, Shiquan, et autres
Publié: (2025)
par: Wang, Shiquan, et autres
Publié: (2025)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
Extracting books from production language models
par: Ahmed, Ahmed, et autres
Publié: (2026)
par: Ahmed, Ahmed, et autres
Publié: (2026)
GPT-ology, Computational Models, Silicon Sampling: How should we think about LLMs in Cognitive Science?
par: Ong, Desmond C.
Publié: (2024)
par: Ong, Desmond C.
Publié: (2024)
SATBench: Benchmarking LLMs' Logical Reasoning via Automated Puzzle Generation from SAT Formulas
par: Wei, Anjiang, et autres
Publié: (2025)
par: Wei, Anjiang, et autres
Publié: (2025)
IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systems
par: Zhang, Xinjie, et autres
Publié: (2025)
par: Zhang, Xinjie, et autres
Publié: (2025)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
par: Zhang, Naifan, et autres
Publié: (2026)
par: Zhang, Naifan, et autres
Publié: (2026)
Can LLMs replace Neil deGrasse Tyson? Evaluating the Reliability of LLMs as Science Communicators
par: Bajpai, Prasoon, et autres
Publié: (2024)
par: Bajpai, Prasoon, et autres
Publié: (2024)
Reliable and Efficient Amortized Model-based Evaluation
par: Truong, Sang, et autres
Publié: (2025)
par: Truong, Sang, et autres
Publié: (2025)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
par: Ou, Jiao, et autres
Publié: (2023)
par: Ou, Jiao, et autres
Publié: (2023)
The Colorful Future of LLMs: Evaluating and Improving LLMs as Emotional Supporters for Queer Youth
par: Lissak, Shir, et autres
Publié: (2024)
par: Lissak, Shir, et autres
Publié: (2024)
From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
par: Zhou, Zhanke, et autres
Publié: (2025)
par: Zhou, Zhanke, et autres
Publié: (2025)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
par: Deng, Yayue, et autres
Publié: (2025)
par: Deng, Yayue, et autres
Publié: (2025)
Are Domain Generalization Benchmarks with Accuracy on the Line Misspecified?
par: Salaudeen, Olawale, et autres
Publié: (2025)
par: Salaudeen, Olawale, et autres
Publié: (2025)
Lean-ing on Quality: How High-Quality Data Beats Diverse Multilingual Data in AutoFormalization
par: Chan, Willy, et autres
Publié: (2025)
par: Chan, Willy, et autres
Publié: (2025)
Fantastic Bugs and Where to Find Them in AI Benchmarks
par: Truong, Sang, et autres
Publié: (2025)
par: Truong, Sang, et autres
Publié: (2025)
Dialogue Benchmark Generation from Knowledge Graphs with Cost-Effective Retrieval-Augmented LLMs
par: Omar, Reham, et autres
Publié: (2025)
par: Omar, Reham, et autres
Publié: (2025)
Benchmarking and Adapting On-Device LLMs for Clinical Decision Support
par: Munim, Alif, et autres
Publié: (2025)
par: Munim, Alif, et autres
Publié: (2025)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
Quantifying the Importance of Data Alignment in Downstream Model Performance
par: Chawla, Krrish, et autres
Publié: (2025)
par: Chawla, Krrish, et autres
Publié: (2025)
DialogueForge: LLM Simulation of Human-Chatbot Dialogue
par: Zhu, Ruizhe, et autres
Publié: (2025)
par: Zhu, Ruizhe, et autres
Publié: (2025)
ZIP-FIT: Embedding-Free Data Selection via Compression-Based Alignment
par: Obbad, Elyas, et autres
Publié: (2024)
par: Obbad, Elyas, et autres
Publié: (2024)
Are You Human? An Adversarial Benchmark to Expose LLMs
par: Gressel, Gilad, et autres
Publié: (2024)
par: Gressel, Gilad, et autres
Publié: (2024)
UQ: Assessing Language Models on Unsolved Questions
par: Nie, Fan, et autres
Publié: (2025)
par: Nie, Fan, et autres
Publié: (2025)
ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support
par: Chen, Tiantian, et autres
Publié: (2026)
par: Chen, Tiantian, et autres
Publié: (2026)
Dialogue Agents 101: A Beginner's Guide to Critical Ingredients for Designing Effective Conversational Systems
par: Kumar, Shivani, et autres
Publié: (2023)
par: Kumar, Shivani, et autres
Publié: (2023)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Large Language Models Produce Responses Perceived to be Empathic
par: Lee, Yoon Kyung, et autres
Publié: (2024)
par: Lee, Yoon Kyung, et autres
Publié: (2024)
In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
par: Tang, Zeyu, et autres
Publié: (2026)
par: Tang, Zeyu, et autres
Publié: (2026)
Investigating Data Contamination for Pre-training Language Models
par: Jiang, Minhao, et autres
Publié: (2024)
par: Jiang, Minhao, et autres
Publié: (2024)
DER-GCN: Dialogue and Event Relation-Aware Graph Convolutional Neural Network for Multimodal Dialogue Emotion Recognition
par: Ai, Wei, et autres
Publié: (2023)
par: Ai, Wei, et autres
Publié: (2023)
CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs
par: Vo, Truong, et autres
Publié: (2025)
par: Vo, Truong, et autres
Publié: (2025)
Is Pre-training Truly Better Than Meta-Learning?
par: Miranda, Brando, et autres
Publié: (2023)
par: Miranda, Brando, et autres
Publié: (2023)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
Documents similaires
-
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
par: Iyer, Laya, et autres
Publié: (2026) -
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
par: Tanmay, Kumar, et autres
Publié: (2025) -
Logits are All We Need to Adapt Closed Models
par: Hiranandani, Gaurush, et autres
Publié: (2025) -
The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior
par: Wang, Angelina, et autres
Publié: (2025) -
Lottery Ticket Adaptation: Mitigating Destructive Interference in LLMs
par: Panda, Ashwinee, et autres
Publié: (2024)