MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Hoyun, Kang, Migyeong, Shin, Jisu, Kim, Jihyun, Park, Chanbi, Yoo, Hangyeol, An, Jihyun, Oh, Alice, Han, Jinyoung, Lim, KyungTae |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TREX: Tokenizer Regression for Optimal Data Mixture
par: Won, Inho, et autres
Publié: (2026)
par: Won, Inho, et autres
Publié: (2026)
SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification
par: Kang, Migyeong, et autres
Publié: (2026)
par: Kang, Migyeong, et autres
Publié: (2026)
Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
par: Shin, Jisu, et autres
Publié: (2025)
par: Shin, Jisu, et autres
Publié: (2025)
Enriching the Korean Learner Corpus with Multi-reference Annotations and Rubric-Based Scoring
par: Song, Jayoung, et autres
Publié: (2025)
par: Song, Jayoung, et autres
Publié: (2025)
Korean Named Entity Recognition Based on Language-Specific Features
par: Chen, Yige, et autres
Publié: (2023)
par: Chen, Yige, et autres
Publié: (2023)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
par: Shin, Jisu, et autres
Publié: (2025)
par: Shin, Jisu, et autres
Publié: (2025)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
par: Lim, Hyeonseok, et autres
Publié: (2024)
par: Lim, Hyeonseok, et autres
Publié: (2024)
Do matching skill sets matter? Exploring the relationship between motivation, satisfaction, and role identification in the context of older adults' volunteering
par: Jihyun Park
Publié: (2024)
par: Jihyun Park
Publié: (2024)
Enhancing Korean Dependency Parsing with Morphosyntactic Features
par: Park, Jungyeul, et autres
Publié: (2025)
par: Park, Jungyeul, et autres
Publié: (2025)
Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation
par: Lee, Huije, et autres
Publié: (2026)
par: Lee, Huije, et autres
Publié: (2026)
Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillation
par: Song, Hoyun, et autres
Publié: (2025)
par: Song, Hoyun, et autres
Publié: (2025)
Learning Constituent Headedness
par: Qi, Zeyao, et autres
Publié: (2026)
par: Qi, Zeyao, et autres
Publié: (2026)
Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback
par: Lee, Inhyo, et autres
Publié: (2025)
par: Lee, Inhyo, et autres
Publié: (2025)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
par: Hwang, Bokwang, et autres
Publié: (2025)
par: Hwang, Bokwang, et autres
Publié: (2025)
Log Heston Model for Monthly Average VIX
par: Park, Jihyun, et autres
Publié: (2024)
par: Park, Jihyun, et autres
Publié: (2024)
Zero-Coupon Treasury Rates and Returns using the Volatility Index
par: Park, Jihyun, et autres
Publié: (2024)
par: Park, Jihyun, et autres
Publié: (2024)
The VIX as Stochastic Volatility for Corporate Bonds
par: Park, Jihyun, et autres
Publié: (2024)
par: Park, Jihyun, et autres
Publié: (2024)
NOE analysis using dual injection DNP‐NMR for studies of solvent–solute interactions at low concentrations
par: Jihyun Kim
Publié: (2024)
par: Jihyun Kim
Publié: (2024)
Recent Findings from the Telescope Array Experiment
par: Kim, Jihyun
Publié: (2026)
par: Kim, Jihyun
Publié: (2026)
Developing an instrument to measure Korean pre‐service teachers' understanding of language as an epistemic tool in mathematics education
par: Jihyun Hwang
Publié: (2024)
par: Jihyun Hwang
Publié: (2024)
KORMo: Korean Open Reasoning Model for Everyone
par: Kim, Minjun, et autres
Publié: (2025)
par: Kim, Minjun, et autres
Publié: (2025)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
par: Choi, ChangSu, et autres
Publié: (2025)
par: Choi, ChangSu, et autres
Publié: (2025)
K-UD: Revising Korean Universal Dependencies Guidelines
par: Kim, Kyuwon, et autres
Publié: (2024)
par: Kim, Kyuwon, et autres
Publié: (2024)
Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models
par: Shin, Jisu, et autres
Publié: (2024)
par: Shin, Jisu, et autres
Publié: (2024)
Different Bias Under Different Criteria: Assessing Bias in LLMs with a Fact-Based Approach
par: Ko, Changgeon, et autres
Publié: (2024)
par: Ko, Changgeon, et autres
Publié: (2024)
Topical dexamethasone decelerates epithelial migration on the canine tympanic membrane
par: Jihyun Kim, et autres
Publié: (2024)
par: Jihyun Kim, et autres
Publié: (2024)
Asynchronous Sharpness-Aware Minimization For Fast and Accurate Deep Learning
par: Jo, Junhyuk, et autres
Publié: (2025)
par: Jo, Junhyuk, et autres
Publié: (2025)
MPMAvatar: Learning 3D Gaussian Avatars with Accurate and Robust Physics-Based Dynamics
par: Lee, Changmin, et autres
Publié: (2025)
par: Lee, Changmin, et autres
Publié: (2025)
MedRegion-CT: Region-Focused Multimodal LLM for Comprehensive 3D CT Report Generation
par: Kyung, Sunggu, et autres
Publié: (2025)
par: Kyung, Sunggu, et autres
Publié: (2025)
Associations between dietary patterns, gut microbiome diversity, and itch severity in preschool aged children with atopic dermatitis: A cross‐sectional study
par: Jisu Park, et autres
Publié: (2025)
par: Jisu Park, et autres
Publié: (2025)
Multi‐Dimensional Physically Unclonable Functions: Optoelectronic Variation‐Induced Multi‐Key Generation from Small Molecule PN Heterostructures
par: Jihyun Shin, et autres
Publié: (2024)
par: Jihyun Shin, et autres
Publié: (2024)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
par: Kyung, Sunggu, et autres
Publié: (2025)
par: Kyung, Sunggu, et autres
Publié: (2025)
ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs
par: Yoo, HanGyeol, et autres
Publié: (2026)
par: Yoo, HanGyeol, et autres
Publié: (2026)
Real world prescription of beta‐blockers in patients with asthma
par: Jihyun Lee, et autres
Publié: (2024)
par: Jihyun Lee, et autres
Publié: (2024)
Efficacy of Mindfulness‐Based Interventions for Reducing Cancer‐Related Fatigue: A Systematic Review and Meta‐Analysis
par: Jihyun Lee, et autres
Publié: (2026)
par: Jihyun Lee, et autres
Publié: (2026)
An unexpected property of $\mathbf{g}$-vectors for rank 3 mutation-cyclic quivers
par: Lee, Jihyun, et autres
Publié: (2024)
par: Lee, Jihyun, et autres
Publié: (2024)
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
par: Moon, Jihyun, et autres
Publié: (2025)
par: Moon, Jihyun, et autres
Publié: (2025)
Ultrathin Gallium Oxide as Both Surface Passivation Layer with Conductive Filament Contacts and Alternative Gate Dielectric for 2D MOSFETs
par: Sanghyun Moon, et autres
Publié: (2025)
par: Sanghyun Moon, et autres
Publié: (2025)
Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives
par: Ko, Changgeon, et autres
Publié: (2026)
par: Ko, Changgeon, et autres
Publié: (2026)
Documents similaires
-
TREX: Tokenizer Regression for Optimal Data Mixture
par: Won, Inho, et autres
Publié: (2026) -
SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification
par: Kang, Migyeong, et autres
Publié: (2026) -
Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support
par: Lee, Daeun, et autres
Publié: (2026) -
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
par: Shin, Jisu, et autres
Publié: (2025) -
Enriching the Korean Learner Corpus with Multi-reference Annotations and Rubric-Based Scoring
par: Song, Jayoung, et autres
Publié: (2025)