Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yinzhu, Maiga, Abdine, Rahmani, Hossein A., Yilmaz, Emine |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Correcting Large Language Models: Generation vs. Multiple Choice
par: Rahmani, Hossein A., et autres
Publié: (2025)
par: Rahmani, Hossein A., et autres
Publié: (2025)
Understanding the Role of User Profile in the Personalization of Large Language Models
par: Wu, Bin, et autres
Publié: (2024)
par: Wu, Bin, et autres
Publié: (2024)
PREF: Reference-Free Evaluation of Personalised Text Generation in LLMs
par: Fu, Xiao, et autres
Publié: (2025)
par: Fu, Xiao, et autres
Publié: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
par: Zhang, Yifei, et autres
Publié: (2026)
par: Zhang, Yifei, et autres
Publié: (2026)
Beyond Output Critique: Self-Correction via Task Distillation
par: Rahmani, Hossein A., et autres
Publié: (2026)
par: Rahmani, Hossein A., et autres
Publié: (2026)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation
par: Rahmani, Mahdi, et autres
Publié: (2025)
par: Rahmani, Mahdi, et autres
Publié: (2025)
Incorporating Error Level Noise Embedding for Improving LLM-Assisted Robustness in Persian Speech Recognition
par: Rahmani, Zahra, et autres
Publié: (2025)
par: Rahmani, Zahra, et autres
Publié: (2025)
Overview of the TREC 2023 deep learning track
par: Craswell, Nick, et autres
Publié: (2025)
par: Craswell, Nick, et autres
Publié: (2025)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
par: Hong, Yihan, et autres
Publié: (2026)
par: Hong, Yihan, et autres
Publié: (2026)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
Adaptive Multi-Agent Response Refinement in Conversational Systems
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Synthesis and Evaluation of Long-term History-aware Medical Dialogue
par: Hu, Hebin, et autres
Publié: (2026)
par: Hu, Hebin, et autres
Publié: (2026)
Medical Dialogue: A Survey of Categories, Methods, Evaluation and Challenges
par: Shi, Xiaoming, et autres
Publié: (2024)
par: Shi, Xiaoming, et autres
Publié: (2024)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
par: Sharma, Manasi, et autres
Publié: (2025)
par: Sharma, Manasi, et autres
Publié: (2025)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
par: Liu, Xue, et autres
Publié: (2026)
par: Liu, Xue, et autres
Publié: (2026)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
par: Wu, Peilin, et autres
Publié: (2026)
par: Wu, Peilin, et autres
Publié: (2026)
Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams
par: Tang, Xiuxiu, et autres
Publié: (2026)
par: Tang, Xiuxiu, et autres
Publié: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning
par: Zhang, Yang, et autres
Publié: (2025)
par: Zhang, Yang, et autres
Publié: (2025)
Online Rubrics Elicitation from Pairwise Comparisons
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
par: Pombal, José, et autres
Publié: (2026)
par: Pombal, José, et autres
Publié: (2026)
MEDSAGE: Enhancing Robustness of Medical Dialogue Summarization to ASR Errors with LLM-generated Synthetic Dialogues
par: Binici, Kuluhan, et autres
Publié: (2024)
par: Binici, Kuluhan, et autres
Publié: (2024)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
par: Qiao, Shuofei, et autres
Publié: (2026)
par: Qiao, Shuofei, et autres
Publié: (2026)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes
par: Shah, Raj Sanjay, et autres
Publié: (2025)
par: Shah, Raj Sanjay, et autres
Publié: (2025)
Synthetic Test Collections for Retrieval Evaluation
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
par: Ou, Jiao, et autres
Publié: (2023)
par: Ou, Jiao, et autres
Publié: (2023)
Towards Understanding Bias in Synthetic Data for Evaluation
par: Rahmani, Hossein A., et autres
Publié: (2025)
par: Rahmani, Hossein A., et autres
Publié: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations
par: Liu, Zijie, et autres
Publié: (2025)
par: Liu, Zijie, et autres
Publié: (2025)
PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistants
par: Zhao, Zheng, et autres
Publié: (2025)
par: Zhao, Zheng, et autres
Publié: (2025)
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
par: Fan, Zhiting, et autres
Publié: (2026)
par: Fan, Zhiting, et autres
Publié: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
Reasoning Like a Doctor: Improving Medical Dialogue Systems via Diagnostic Reasoning Process Alignment
par: Xu, Kaishuai, et autres
Publié: (2024)
par: Xu, Kaishuai, et autres
Publié: (2024)
Beyond Internal Data: Constructing Complete Datasets for Fairness Testing
par: Ramineni, Varsha, et autres
Publié: (2025)
par: Ramineni, Varsha, et autres
Publié: (2025)
Documents similaires
-
Self-Correcting Large Language Models: Generation vs. Multiple Choice
par: Rahmani, Hossein A., et autres
Publié: (2025) -
Understanding the Role of User Profile in the Personalization of Large Language Models
par: Wu, Bin, et autres
Publié: (2024) -
PREF: Reference-Free Evaluation of Personalised Text Generation in LLMs
par: Fu, Xiao, et autres
Publié: (2025) -
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026) -
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
par: Zhang, Yifei, et autres
Publié: (2026)