CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Byun, Grace, Lipschutz, Rebecca, Minton, Sean T., Lott, Abigail, Choi, Jinho D. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
by: Hong, Jiseung, et al.
Published: (2025)
by: Hong, Jiseung, et al.
Published: (2025)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
by: Yilmaz, Abdurrahim, et al.
Published: (2026)
by: Yilmaz, Abdurrahim, et al.
Published: (2026)
HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats
by: Hicks, Rebecca Soskin, et al.
Published: (2026)
by: Hicks, Rebecca Soskin, et al.
Published: (2026)
TRUST: An LLM-Based Dialogue System for Trauma Understanding and Structured Assessments
by: Tu, Sichang, et al.
Published: (2025)
by: Tu, Sichang, et al.
Published: (2025)
MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare
by: Lamparth, Max, et al.
Published: (2025)
by: Lamparth, Max, et al.
Published: (2025)
Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models
by: Wu, Peilin, et al.
Published: (2025)
by: Wu, Peilin, et al.
Published: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
by: Xiong, Zixin, et al.
Published: (2026)
by: Xiong, Zixin, et al.
Published: (2026)
Diverse and Effective Synthetic Data Generation for Adaptable Zero-Shot Dialogue State Tracking
by: Finch, James D., et al.
Published: (2024)
by: Finch, James D., et al.
Published: (2024)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
by: Pombal, José, et al.
Published: (2025)
by: Pombal, José, et al.
Published: (2025)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
by: Zhou, Yujun, et al.
Published: (2024)
by: Zhou, Yujun, et al.
Published: (2024)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
by: Zhao, Haochen, et al.
Published: (2024)
by: Zhao, Haochen, et al.
Published: (2024)
ConvoSense: Overcoming Monotonous Commonsense Inferences for Conversational AI
by: Finch, Sarah E., et al.
Published: (2024)
by: Finch, Sarah E., et al.
Published: (2024)
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
by: Finch, Sarah E., et al.
Published: (2024)
by: Finch, Sarah E., et al.
Published: (2024)
CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering
by: Li, Yahan, et al.
Published: (2025)
by: Li, Yahan, et al.
Published: (2025)
MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations
by: Ma, Congbo, et al.
Published: (2026)
by: Ma, Congbo, et al.
Published: (2026)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
by: Choi, Nayoung, et al.
Published: (2026)
by: Choi, Nayoung, et al.
Published: (2026)
3M-Health: Multimodal Multi-Teacher Knowledge Distillation for Mental Health Detection
by: Cabral, Rina Carines, et al.
Published: (2024)
by: Cabral, Rina Carines, et al.
Published: (2024)
BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation
by: Wenz, Fabian, et al.
Published: (2025)
by: Wenz, Fabian, et al.
Published: (2025)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
by: Choi, Dasol, et al.
Published: (2026)
by: Choi, Dasol, et al.
Published: (2026)
CARBD-Ko: A Contextually Annotated Review Benchmark Dataset for Aspect-Level Sentiment Classification in Korean
by: Jang, Dongjun, et al.
Published: (2024)
by: Jang, Dongjun, et al.
Published: (2024)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
by: Liu, Xuannan, et al.
Published: (2025)
by: Liu, Xuannan, et al.
Published: (2025)
A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection
by: Hasan, Khalid, et al.
Published: (2026)
by: Hasan, Khalid, et al.
Published: (2026)
Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs
by: Arnaiz-Rodriguez, Adrian, et al.
Published: (2025)
by: Arnaiz-Rodriguez, Adrian, et al.
Published: (2025)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
by: Jeon, Hyunbae, et al.
Published: (2026)
by: Jeon, Hyunbae, et al.
Published: (2026)
BenchBench: Benchmarking Automated Benchmark Generation
by: Zheng, Yandan, et al.
Published: (2026)
by: Zheng, Yandan, et al.
Published: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
by: Zhang, Wenjing, et al.
Published: (2024)
by: Zhang, Wenjing, et al.
Published: (2024)
Automating PTSD Diagnostics in Clinical Interviews: Leveraging Large Language Models for Trauma Assessments
by: Tu, Sichang, et al.
Published: (2024)
by: Tu, Sichang, et al.
Published: (2024)
OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs
by: Racha, Suraj, et al.
Published: (2026)
by: Racha, Suraj, et al.
Published: (2026)
Multi-Facet Blending for Faceted Query-by-Example Retrieval
by: Do, Heejin, et al.
Published: (2024)
by: Do, Heejin, et al.
Published: (2024)
Generative Induction of Dialogue Task Schemas with Streaming Refinement and Simulated Interactions
by: Finch, James D., et al.
Published: (2025)
by: Finch, James D., et al.
Published: (2025)
Transforming Slot Schema Induction with Generative Dialogue State Inference
by: Finch, James D., et al.
Published: (2024)
by: Finch, James D., et al.
Published: (2024)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
by: Lee, Juyong, et al.
Published: (2024)
by: Lee, Juyong, et al.
Published: (2024)
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
by: Cobben, Pepijn, et al.
Published: (2026)
by: Cobben, Pepijn, et al.
Published: (2026)
Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
by: Zaghouani, Wajdi, et al.
Published: (2026)
by: Zaghouani, Wajdi, et al.
Published: (2026)
Finding A Voice: Exploring the Potential of African American Dialect and Voice Generation for Chatbots
by: Finch, Sarah E., et al.
Published: (2025)
by: Finch, Sarah E., et al.
Published: (2025)
What is Your Favorite Gender, MLM? Gender Bias Evaluation in Multilingual Masked Language Models
by: Yu, Jeongrok, et al.
Published: (2024)
by: Yu, Jeongrok, et al.
Published: (2024)
Similar Items
-
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025) -
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
by: Byun, Grace, et al.
Published: (2025) -
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025) -
Measuring Sycophancy of Language Models in Multi-turn Dialogues
by: Hong, Jiseung, et al.
Published: (2025) -
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
by: Yilmaz, Abdurrahim, et al.
Published: (2026)