MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Weixin, Ni, Congning, Mulvaney, Shelagh A., Rose, Susannah L., Kantarcioglu, Murat, Malin, Bradley A., Yin, Zhijun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses
by: Hussain, Khizar, et al.
Published: (2026)
by: Hussain, Khizar, et al.
Published: (2026)
Disentangling Prompt Element Level Risk Factors for Hallucinations and Omissions in Mental Health LLM Responses
by: Ni, Congning, et al.
Published: (2026)
by: Ni, Congning, et al.
Published: (2026)
Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
SMOTE-DP: Improving Privacy-Utility Tradeoff with Synthetic Data
by: Zhou, Yan, et al.
Published: (2025)
by: Zhou, Yan, et al.
Published: (2025)
Catalysts of Conversation: Examining Interaction Dynamics Between Topic Initiators and Commentors in Alzheimer's Disease Online Communities
by: Ni, Congning, et al.
Published: (2024)
by: Ni, Congning, et al.
Published: (2024)
Do You Know What You Are Talking About? Characterizing Query-Knowledge Relevance For Reliable Retrieval Augmented Generation
by: Li, Zhuohang, et al.
Published: (2024)
by: Li, Zhuohang, et al.
Published: (2024)
Learning When to Sample: Confidence-Aware Self-Consistency for Efficient LLM Chain-of-Thought Reasoning
by: Xiong, Juming, et al.
Published: (2026)
by: Xiong, Juming, et al.
Published: (2026)
PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts
by: Hussain, Khizar, et al.
Published: (2026)
by: Hussain, Khizar, et al.
Published: (2026)
Graph Generative Models Evaluation with Masked Autoencoder
by: Wang, Chengen, et al.
Published: (2025)
by: Wang, Chengen, et al.
Published: (2025)
Optimizing Domain-Adaptive Self-Supervised Learning for Clinical Voice-Based Disease Classification
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
Learning Joint Embeddings of Function and Process Call Graphs for Malware Detection
by: Aneja, Kartikeya, et al.
Published: (2025)
by: Aneja, Kartikeya, et al.
Published: (2025)
MoltGraph: A Longitudinal Temporal Graph Dataset of Moltbook for Coordinated-Agent Detection
by: Mukherjee, Kunal, et al.
Published: (2026)
by: Mukherjee, Kunal, et al.
Published: (2026)
Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks
by: Isbarov, Jafar, et al.
Published: (2026)
by: Isbarov, Jafar, et al.
Published: (2026)
A Review of DeepSeek Models' Key Innovative Techniques
by: Wang, Chengen, et al.
Published: (2025)
by: Wang, Chengen, et al.
Published: (2025)
Ask ChatGPT: Caveats and Mitigations for Individual Users of AI Chatbots
by: Wang, Chengen, et al.
Published: (2025)
by: Wang, Chengen, et al.
Published: (2025)
LLM-driven Provenance Forensics for Threat Investigation and Detection
by: Mukherjee, Kunal, et al.
Published: (2025)
by: Mukherjee, Kunal, et al.
Published: (2025)
How to Backdoor Consistency Models?
by: Wang, Chengen, et al.
Published: (2024)
by: Wang, Chengen, et al.
Published: (2024)
OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs
by: Racha, Suraj, et al.
Published: (2026)
by: Racha, Suraj, et al.
Published: (2026)
Evaluating Class Membership Relations in Knowledge Graphs using Large Language Models
by: Allen, Bradley P., et al.
Published: (2024)
by: Allen, Bradley P., et al.
Published: (2024)
Benchmarking Large Language Models for Knowledge Graph Validation
by: Shami, Farzad, et al.
Published: (2026)
by: Shami, Farzad, et al.
Published: (2026)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
by: Song, Hoyun, et al.
Published: (2026)
by: Song, Hoyun, et al.
Published: (2026)
Adversarial Graph Neural Network Benchmarks: Towards Practical and Fair Evaluation
by: Ngo, Tran Gia Bao, et al.
Published: (2026)
by: Ngo, Tran Gia Bao, et al.
Published: (2026)
A Benchmark for the Detection of Metalinguistic Disagreements between LLMs and Knowledge Graphs
by: Allen, Bradley P., et al.
Published: (2025)
by: Allen, Bradley P., et al.
Published: (2025)
Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval
by: Bunkova, Olga, et al.
Published: (2026)
by: Bunkova, Olga, et al.
Published: (2026)
Combining Knowledge Graphs and Large Language Models
by: Kau, Amanda, et al.
Published: (2024)
by: Kau, Amanda, et al.
Published: (2024)
Enhancing Mental Health Counseling Support in Bangladesh using Culturally-Grounded Knowledge
by: Hasan, Md Arid, et al.
Published: (2026)
by: Hasan, Md Arid, et al.
Published: (2026)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
by: Xiong, Zixin, et al.
Published: (2026)
by: Xiong, Zixin, et al.
Published: (2026)
KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge
by: Robertson, Alex, et al.
Published: (2026)
by: Robertson, Alex, et al.
Published: (2026)
Benchmarking the Pedagogical Knowledge of Large Language Models
by: Lelièvre, Maxime, et al.
Published: (2025)
by: Lelièvre, Maxime, et al.
Published: (2025)
The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability
by: Hu, Guangneng
Published: (2025)
by: Hu, Guangneng
Published: (2025)
Mitigating Hallucinations Using Ensemble of Knowledge Graph and Vector Store in Large Language Models to Enhance Mental Health Support
by: Muqtadir, Abdul, et al.
Published: (2024)
by: Muqtadir, Abdul, et al.
Published: (2024)
Large Language Model for Mental Health: A Systematic Review
by: Guo, Zhijun, et al.
Published: (2024)
by: Guo, Zhijun, et al.
Published: (2024)
Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge
by: Zhao, Runhao, et al.
Published: (2026)
by: Zhao, Runhao, et al.
Published: (2026)
CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering
by: Li, Yahan, et al.
Published: (2025)
by: Li, Yahan, et al.
Published: (2025)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
by: Ma, Kaijing, et al.
Published: (2024)
by: Ma, Kaijing, et al.
Published: (2024)
Large Language Models Meet Biomedical Knowledge Graphs for Mechanistically Grounded Therapeutic Prioritization
by: Wei, Chih-Hsuan, et al.
Published: (2026)
by: Wei, Chih-Hsuan, et al.
Published: (2026)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
by: Sun, Jiashuo, et al.
Published: (2023)
by: Sun, Jiashuo, et al.
Published: (2023)
Towards Temporal Knowledge Graph Alignment in the Wild
by: Zhao, Runhao, et al.
Published: (2025)
by: Zhao, Runhao, et al.
Published: (2025)
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph
by: Liu, Langming, et al.
Published: (2025)
by: Liu, Langming, et al.
Published: (2025)
Similar Items
-
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
by: Liu, Weixin, et al.
Published: (2026) -
Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses
by: Hussain, Khizar, et al.
Published: (2026) -
Disentangling Prompt Element Level Risk Factors for Hallucinations and Omissions in Mental Health LLM Responses
by: Ni, Congning, et al.
Published: (2026) -
Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization
by: Liu, Weixin, et al.
Published: (2026) -
SMOTE-DP: Improving Privacy-Utility Tradeoff with Synthetic Data
by: Zhou, Yan, et al.
Published: (2025)