A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Chen, D'Haro, Luis Fernando, Chen, Yiming, Zhang, Malu, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models
by: Chen, Yiming, et al.
Published: (2024)
by: Chen, Yiming, et al.
Published: (2024)
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025)
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025)
Unsupervised Mutual Learning of Discourse Parsing and Topic Segmentation in Dialogue
by: Xu, Jiahui, et al.
Published: (2024)
by: Xu, Jiahui, et al.
Published: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
by: Chen, Yiming, et al.
Published: (2024)
by: Chen, Yiming, et al.
Published: (2024)
Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12
by: Mendonça, John, et al.
Published: (2025)
by: Mendonça, John, et al.
Published: (2025)
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
by: She, Shuaijie, et al.
Published: (2023)
by: She, Shuaijie, et al.
Published: (2023)
DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models
by: Pan, Jiabao, et al.
Published: (2024)
by: Pan, Jiabao, et al.
Published: (2024)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models
by: Liu, Wanlong, et al.
Published: (2025)
by: Liu, Wanlong, et al.
Published: (2025)
DRE: An Effective Dual-Refined Method for Integrating Small and Large Language Models in Open-Domain Dialogue Evaluation
by: Zhao, Kun, et al.
Published: (2025)
by: Zhao, Kun, et al.
Published: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
Uncovering the Potential of ChatGPT for Discourse Analysis in Dialogue: An Empirical Study
by: Fan, Yaxin, et al.
Published: (2023)
by: Fan, Yaxin, et al.
Published: (2023)
Evaluating Large Language Models in Analysing Classroom Dialogue
by: Long, Yun, et al.
Published: (2024)
by: Long, Yun, et al.
Published: (2024)
Dialogue Language Model with Large-Scale Persona Data Engineering
by: Hong, Mengze, et al.
Published: (2024)
by: Hong, Mengze, et al.
Published: (2024)
Automatic Generation and Evaluation of Reading Comprehension Test Items with Large Language Models
by: Säuberli, Andreas, et al.
Published: (2024)
by: Säuberli, Andreas, et al.
Published: (2024)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
by: Zhou, Jie, et al.
Published: (2025)
by: Zhou, Jie, et al.
Published: (2025)
Large Language Models Penetration in Scholarly Writing and Peer Review
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
by: Zhang, Min, et al.
Published: (2025)
by: Zhang, Min, et al.
Published: (2025)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
by: Chen, Kedi, et al.
Published: (2024)
by: Chen, Kedi, et al.
Published: (2024)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
UNO-DST: Leveraging Unlabelled Data in Zero-Shot Dialogue State Tracking
by: Li, Chuang, et al.
Published: (2023)
by: Li, Chuang, et al.
Published: (2023)
A Comprehensive Evaluation of Large Language Models on Aspect-Based Sentiment Analysis
by: Zhou, Changzhi, et al.
Published: (2024)
by: Zhou, Changzhi, et al.
Published: (2024)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
by: Luo, Wen, et al.
Published: (2024)
by: Luo, Wen, et al.
Published: (2024)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
by: Wei, Fangyun, et al.
Published: (2024)
by: Wei, Fangyun, et al.
Published: (2024)
Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models
by: Liu, Weize, et al.
Published: (2023)
by: Liu, Weize, et al.
Published: (2023)
Visualizing Dialogues: Enhancing Image Selection through Dialogue Understanding with Large Language Models
by: Kao, Chang-Sheng, et al.
Published: (2024)
by: Kao, Chang-Sheng, et al.
Published: (2024)
SLIDE: A Framework Integrating Small and Large Language Models for Open-Domain Dialogues Evaluation
by: Zhao, Kun, et al.
Published: (2024)
by: Zhao, Kun, et al.
Published: (2024)
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
by: Yu, Jing, et al.
Published: (2025)
by: Yu, Jing, et al.
Published: (2025)
TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Models
by: Zhang, Chen, et al.
Published: (2024)
by: Zhang, Chen, et al.
Published: (2024)
URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
by: Yan, Ruiqi, et al.
Published: (2025)
by: Yan, Ruiqi, et al.
Published: (2025)
Automatic Summarization of Doctor-Patient Encounter Dialogues Using Large Language Model through Prompt Tuning
by: Lyu, Mengxian, et al.
Published: (2024)
by: Lyu, Mengxian, et al.
Published: (2024)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
by: Shu, Dong, et al.
Published: (2024)
by: Shu, Dong, et al.
Published: (2024)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
by: Du, Yuhao, et al.
Published: (2025)
by: Du, Yuhao, et al.
Published: (2025)
A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry
by: Huang, Yining, et al.
Published: (2024)
by: Huang, Yining, et al.
Published: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
by: Wang, Siyin, et al.
Published: (2024)
by: Wang, Siyin, et al.
Published: (2024)
Scoring with Large Language Models: A Study on Measuring Empathy of Responses in Dialogues
by: Xie, Henry J., et al.
Published: (2024)
by: Xie, Henry J., et al.
Published: (2024)
Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation
by: Gu, Megan, et al.
Published: (2025)
by: Gu, Megan, et al.
Published: (2025)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
by: Zhang, Qian, et al.
Published: (2024)
by: Zhang, Qian, et al.
Published: (2024)
Similar Items
-
Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models
by: Chen, Yiming, et al.
Published: (2024) -
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025) -
Unsupervised Mutual Learning of Discourse Parsing and Topic Segmentation in Dialogue
by: Xu, Jiahui, et al.
Published: (2024) -
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
by: Chen, Yiming, et al.
Published: (2024) -
Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12
by: Mendonça, John, et al.
Published: (2025)