MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
Fuente:
arXiv
Saved in:
| Main Authors: | Pombal, José, D'Eon, Maya, Guerreiro, Nuno M., Martins, Pedro Henrique, Farinhas, António, Rei, Ricardo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support
by: Farinhas, António, et al.
Published: (2026)
by: Farinhas, António, et al.
Published: (2026)
Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
Adding Chocolate to Mint: Mitigating Metric Interference in Machine Translation
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
Translate Smart, not Hard: Cascaded Translation Systems with Quality-Aware Deferral
by: Farinhas, António, et al.
Published: (2025)
by: Farinhas, António, et al.
Published: (2025)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
by: Pombal, José, et al.
Published: (2026)
by: Pombal, José, et al.
Published: (2026)
Tower+: Bridging Generality and Translation Specialization in Multilingual LLMs
by: Rei, Ricardo, et al.
Published: (2025)
by: Rei, Ricardo, et al.
Published: (2025)
Can Automatic Metrics Assess High-Quality Translations?
by: Agrawal, Sweta, et al.
Published: (2024)
by: Agrawal, Sweta, et al.
Published: (2024)
Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine Translation
by: Agrawal, Sweta, et al.
Published: (2024)
by: Agrawal, Sweta, et al.
Published: (2024)
SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Support
by: Qiu, Huachuan, et al.
Published: (2023)
by: Qiu, Huachuan, et al.
Published: (2023)
xTower: A Multilingual LLM for Explaining and Correcting Translation Errors
by: Treviso, Marcos, et al.
Published: (2024)
by: Treviso, Marcos, et al.
Published: (2024)
EuroLLM: Multilingual Language Models for Europe
by: Martins, Pedro Henrique, et al.
Published: (2024)
by: Martins, Pedro Henrique, et al.
Published: (2024)
Tower: An Open Multilingual Large Language Model for Translation-Related Tasks
by: Alves, Duarte M., et al.
Published: (2024)
by: Alves, Duarte M., et al.
Published: (2024)
SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following
by: Canaverde, Beatriz, et al.
Published: (2026)
by: Canaverde, Beatriz, et al.
Published: (2026)
Reranking Laws for Language Generation: A Communication-Theoretic Perspective
by: Farinhas, António, et al.
Published: (2024)
by: Farinhas, António, et al.
Published: (2024)
QUEST: Quality-Aware Metropolis-Hastings Sampling for Machine Translation
by: Faria, Gonçalo R. A., et al.
Published: (2024)
by: Faria, Gonçalo R. A., et al.
Published: (2024)
MIDAS: Multi-level Intent, Domain, And Slot Knowledge Distillation for Multi-turn NLU
by: Li, Yan, et al.
Published: (2024)
by: Li, Yan, et al.
Published: (2024)
Psy-Insight: Explainable Multi-turn Bilingual Dataset for Mental Health Counseling
by: Chen, Keqi, et al.
Published: (2025)
by: Chen, Keqi, et al.
Published: (2025)
Can Vision Language Models Judge Action Quality? An Empirical Evaluation
by: Freitas, Miguel Monte e, et al.
Published: (2026)
by: Freitas, Miguel Monte e, et al.
Published: (2026)
M-Prometheus: A Suite of Open Multilingual LLM Judges
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
Is Preference Alignment Always the Best Option to Enhance LLM-Based Translation? An Empirical Analysis
by: Gisserot-Boukhlef, Hippolyte, et al.
Published: (2024)
by: Gisserot-Boukhlef, Hippolyte, et al.
Published: (2024)
EuroLLM-9B: Technical Report
by: Martins, Pedro Henrique, et al.
Published: (2025)
by: Martins, Pedro Henrique, et al.
Published: (2025)
Aligning Neural Machine Translation Models: Human Feedback in Training and Inference
by: Ramos, Miguel Moura, et al.
Published: (2023)
by: Ramos, Miguel Moura, et al.
Published: (2023)
Analyzing Context Contributions in LLM-based Machine Translation
by: Zaranis, Emmanouil, et al.
Published: (2024)
by: Zaranis, Emmanouil, et al.
Published: (2024)
Conformal Prediction for Natural Language Processing: A Survey
by: Campos, Margarida M., et al.
Published: (2024)
by: Campos, Margarida M., et al.
Published: (2024)
PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models
by: Jin, Haoan, et al.
Published: (2023)
by: Jin, Haoan, et al.
Published: (2023)
EuroLLM-22B: Technical Report
by: Ramos, Miguel Moura, et al.
Published: (2026)
by: Ramos, Miguel Moura, et al.
Published: (2026)
MindSET: Advancing Mental Health Benchmarking through Large-Scale Social Media Data
by: Mankarious, Saad, et al.
Published: (2025)
by: Mankarious, Saad, et al.
Published: (2025)
CroissantLLM: A Truly Bilingual French-English Language Model
by: Faysse, Manuel, et al.
Published: (2024)
by: Faysse, Manuel, et al.
Published: (2024)
A Context-aware Framework for Translation-mediated Conversations
by: Pombal, José, et al.
Published: (2024)
by: Pombal, José, et al.
Published: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
by: Kwan, Wai-Chung, et al.
Published: (2024)
by: Kwan, Wai-Chung, et al.
Published: (2024)
Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
by: Lee, Seungbeen, et al.
Published: (2025)
by: Lee, Seungbeen, et al.
Published: (2025)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
by: Lee, Suhyun, et al.
Published: (2026)
by: Lee, Suhyun, et al.
Published: (2026)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
by: Sun, Liangtai, et al.
Published: (2023)
by: Sun, Liangtai, et al.
Published: (2023)
Can AI Relate: Testing Large Language Model Response for Mental Health Support
by: Gabriel, Saadia, et al.
Published: (2024)
by: Gabriel, Saadia, et al.
Published: (2024)
Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction
by: Fang, Jinrui, et al.
Published: (2026)
by: Fang, Jinrui, et al.
Published: (2026)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
by: Dong, Xuan, et al.
Published: (2026)
by: Dong, Xuan, et al.
Published: (2026)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
by: Cheng, Yiruo, et al.
Published: (2024)
by: Cheng, Yiruo, et al.
Published: (2024)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
by: Hong, Jiseung, et al.
Published: (2025)
by: Hong, Jiseung, et al.
Published: (2025)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
by: Zhao, Haiquan, et al.
Published: (2024)
by: Zhao, Haiquan, et al.
Published: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
by: Shi, Ling, et al.
Published: (2024)
by: Shi, Ling, et al.
Published: (2024)
Similar Items
-
MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support
by: Farinhas, António, et al.
Published: (2026) -
Zero-shot Benchmarking: A Framework for Flexible and Scalable Automatic Evaluation of Language Models
by: Pombal, José, et al.
Published: (2025) -
Adding Chocolate to Mint: Mitigating Metric Interference in Machine Translation
by: Pombal, José, et al.
Published: (2025) -
Translate Smart, not Hard: Cascaded Translation Systems with Quality-Aware Deferral
by: Farinhas, António, et al.
Published: (2025) -
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
by: Pombal, José, et al.
Published: (2026)