MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Gong, Lecheng, Fang, Weimin, Yang, Ting, Tao, Dongjie, Guo, Chunxiao, Wei, Peng, Xie, Bo, Guan, Jinqun, Chen, Zixiao, Shi, Fang, Gu, Jinjie, Liu, Junwei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
3MDBench: Medical Multimodal Multi-agent Dialogue Benchmark
by: Sviridov, Ivan, et al.
Published: (2025)
by: Sviridov, Ivan, et al.
Published: (2025)
Can Online GenAI Discussion Serve as Bellwether for Labor Market Shifts?
by: Cao, Shurui, et al.
Published: (2025)
by: Cao, Shurui, et al.
Published: (2025)
MedAI Dialog Corpus (MEDIC): Zero-Shot Classification of Doctor and AI Responses in Health Consultations
by: Ojo, Olumide E., et al.
Published: (2023)
by: Ojo, Olumide E., et al.
Published: (2023)
GPT is Not an Annotator: The Necessity of Human Annotation in Fairness Benchmark Construction
by: Felkner, Virginia K., et al.
Published: (2024)
by: Felkner, Virginia K., et al.
Published: (2024)
SAGED: A Holistic Bias-Benchmarking Pipeline for Language Models with Customisable Fairness Calibration
by: Guan, Xin, et al.
Published: (2024)
by: Guan, Xin, et al.
Published: (2024)
MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework
by: Yu, Ailing, et al.
Published: (2025)
by: Yu, Ailing, et al.
Published: (2025)
Termination of Innermost-Terminating Right-Linear Overlay Term Rewrite Systems (Full Version)
by: Nishida, Naoki
Published: (2026)
by: Nishida, Naoki
Published: (2026)
Rewriting Induction for Existentially Quantified Equations in Logically Constrained Rewriting (Full Version)
by: Nishida, Naoki, et al.
Published: (2026)
by: Nishida, Naoki, et al.
Published: (2026)
Abstract Framework for All-Path Reachability Analysis toward Safety and Liveness Verification (Full Version)
by: Kojima, Misaki, et al.
Published: (2026)
by: Kojima, Misaki, et al.
Published: (2026)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
by: Shang, Fangxin, et al.
Published: (2025)
by: Shang, Fangxin, et al.
Published: (2025)
From Pre-trained Models to Large Language Models: A Comprehensive Survey of AI-Driven Psychological Computing
by: Chen, Huiyao, et al.
Published: (2026)
by: Chen, Huiyao, et al.
Published: (2026)
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
by: Shi, Baorong, et al.
Published: (2026)
by: Shi, Baorong, et al.
Published: (2026)
Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction
by: Fang, Jinrui, et al.
Published: (2026)
by: Fang, Jinrui, et al.
Published: (2026)
The Problem of Alignment
by: Hristova, Tsvetelina, et al.
Published: (2023)
by: Hristova, Tsvetelina, et al.
Published: (2023)
Automating Thematic Analysis: How LLMs Analyse Controversial Topics
by: Khan, Awais Hameed, et al.
Published: (2024)
by: Khan, Awais Hameed, et al.
Published: (2024)
Reproduction Research of FSA-Benchmark
by: Ludolf, Joshua, et al.
Published: (2024)
by: Ludolf, Joshua, et al.
Published: (2024)
MISCON: A Mission-Driven Conversational Consultant for Pre-Venture Entrepreneurs in Food Deserts
by: Dasgupta, Subhasis, et al.
Published: (2025)
by: Dasgupta, Subhasis, et al.
Published: (2025)
An Automated Tool to Detect Suicidal Susceptibility from Social Media Posts
by: Dus, Yasin, et al.
Published: (2023)
by: Dus, Yasin, et al.
Published: (2023)
Fairness in Socio-technical Systems: a Case Study of Wikipedia
by: Damadi, Mir Saeed, et al.
Published: (2023)
by: Damadi, Mir Saeed, et al.
Published: (2023)
Generative AI and the transformation of Work in Latin America -- Brazil
by: Bonfacio, Carmen, et al.
Published: (2025)
by: Bonfacio, Carmen, et al.
Published: (2025)
Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF
by: Sami, K. M. Jubair, et al.
Published: (2026)
by: Sami, K. M. Jubair, et al.
Published: (2026)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
by: Guan, Xin, et al.
Published: (2026)
by: Guan, Xin, et al.
Published: (2026)
FairFedMed: Benchmarking Group Fairness in Federated Medical Imaging with FairLoRA
by: Li, Minghan, et al.
Published: (2025)
by: Li, Minghan, et al.
Published: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
by: Ye, Zhiling, et al.
Published: (2025)
by: Ye, Zhiling, et al.
Published: (2025)
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
by: Chen, Sirry, et al.
Published: (2026)
by: Chen, Sirry, et al.
Published: (2026)
Are You Comfortable Sharing It?: Leveraging Image Obfuscation Techniques to Enhance Sharing Privacy for Blind and Visually Impaired Users
by: Das, Satabdi, et al.
Published: (2026)
by: Das, Satabdi, et al.
Published: (2026)
User-Centered-Design as an Empty Signifier in the Context of Developing Digital Applications
by: Sariyar, Murat
Published: (2025)
by: Sariyar, Murat
Published: (2025)
Demo of picoRing mouse: an ultra-low-powered wireless mouse ring with ring-to-wristband coil-based impedance sensing
by: Li, Yifan, et al.
Published: (2025)
by: Li, Yifan, et al.
Published: (2025)
How Participants Respond to Computer Delays
by: Scholz, Désirée, et al.
Published: (2024)
by: Scholz, Désirée, et al.
Published: (2024)
ORES-Inspect: A technology probe for machine learning audits on enwiki
by: Levonian, Zachary, et al.
Published: (2024)
by: Levonian, Zachary, et al.
Published: (2024)
LangMARL: Natural Language Multi-Agent Reinforcement Learning
by: Yao, Huaiyuan, et al.
Published: (2026)
by: Yao, Huaiyuan, et al.
Published: (2026)
CoSight: Exploring Viewer Contributions to Online Video Accessibility Through Descriptive Commenting
by: wang, Ruolin, et al.
Published: (2025)
by: wang, Ruolin, et al.
Published: (2025)
Automating proof search when equality is a logical connective
by: Chaudhuri, Kaustuv, et al.
Published: (2026)
by: Chaudhuri, Kaustuv, et al.
Published: (2026)
Reassurance Robots: OCD in the Age of Generative AI
by: Barkhuff, Grace
Published: (2026)
by: Barkhuff, Grace
Published: (2026)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
by: Jin, Congyun, et al.
Published: (2024)
by: Jin, Congyun, et al.
Published: (2024)
Context-Aware Detection and Victim-Centered Response Generation for Online Harassment in Private Messaging
by: Lu, Pinxian, et al.
Published: (2025)
by: Lu, Pinxian, et al.
Published: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
by: Hsu, Hsin-Ling, et al.
Published: (2026)
by: Hsu, Hsin-Ling, et al.
Published: (2026)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare
by: Nigam, Shubham Kumar, et al.
Published: (2026)
by: Nigam, Shubham Kumar, et al.
Published: (2026)
Similar Items
-
3MDBench: Medical Multimodal Multi-agent Dialogue Benchmark
by: Sviridov, Ivan, et al.
Published: (2025) -
Can Online GenAI Discussion Serve as Bellwether for Labor Market Shifts?
by: Cao, Shurui, et al.
Published: (2025) -
MedAI Dialog Corpus (MEDIC): Zero-Shot Classification of Doctor and AI Responses in Health Consultations
by: Ojo, Olumide E., et al.
Published: (2023) -
GPT is Not an Annotator: The Necessity of Human Annotation in Fairness Benchmark Construction
by: Felkner, Virginia K., et al.
Published: (2024) -
SAGED: A Holistic Bias-Benchmarking Pipeline for Language Models with Customisable Fairness Calibration
by: Guan, Xin, et al.
Published: (2024)