An Empirical Analysis on Large Language Models in Debate Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Xinyi, Liu, Pinxin, He, Hangfeng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Role of Model Confidence on Bias Effects in Measured Uncertainties for Vision-Language Models
by: Liu, Xinyi, et al.
Published: (2025)
by: Liu, Xinyi, et al.
Published: (2025)
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
by: He, Hangfeng, et al.
Published: (2023)
by: He, Hangfeng, et al.
Published: (2023)
A Law of Next-Token Prediction in Large Language Models
by: He, Hangfeng, et al.
Published: (2024)
by: He, Hangfeng, et al.
Published: (2024)
On the Role of Model Prior in Real-World Inductive Reasoning
by: Liu, Zhuo, et al.
Published: (2024)
by: Liu, Zhuo, et al.
Published: (2024)
Unveiling Divergent Inductive Biases of LLMs on Temporal Data
by: Kishore, Sindhu, et al.
Published: (2024)
by: Kishore, Sindhu, et al.
Published: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
by: Xie, Qiujie, et al.
Published: (2025)
by: Xie, Qiujie, et al.
Published: (2025)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
by: Liu, Yinuo, et al.
Published: (2026)
by: Liu, Yinuo, et al.
Published: (2026)
Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware Prompting
by: Wu, Jiarui, et al.
Published: (2025)
by: Wu, Jiarui, et al.
Published: (2025)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
by: Chern, Steffi, et al.
Published: (2024)
by: Chern, Steffi, et al.
Published: (2024)
Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
by: Liu, Shuodi, et al.
Published: (2025)
by: Liu, Shuodi, et al.
Published: (2025)
Empirical Analysis of Dialogue Relation Extraction with Large Language Models
by: Li, Guozheng, et al.
Published: (2024)
by: Li, Guozheng, et al.
Published: (2024)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
by: Xiong, Kai, et al.
Published: (2023)
by: Xiong, Kai, et al.
Published: (2023)
Evaluating the Performance of Large Language Models via Debates
by: Moniri, Behrad, et al.
Published: (2024)
by: Moniri, Behrad, et al.
Published: (2024)
An Empirical Evaluation of Large Language Models on Consumer Health Questions
by: Abrar, Moaiz, et al.
Published: (2024)
by: Abrar, Moaiz, et al.
Published: (2024)
Assisted Debate Builder with Large Language Models
by: Faugier, Elliot, et al.
Published: (2024)
by: Faugier, Elliot, et al.
Published: (2024)
Large Language Models and the Rationalist Empiricist Debate
by: King, David
Published: (2024)
by: King, David
Published: (2024)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
by: Yang, Xinqi, et al.
Published: (2024)
by: Yang, Xinqi, et al.
Published: (2024)
$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion
by: Bi, Jing, et al.
Published: (2025)
by: Bi, Jing, et al.
Published: (2025)
An Empirical Study of the Role of Incompleteness and Ambiguity in Interactions with Large Language Models
by: Naik, Riya, et al.
Published: (2025)
by: Naik, Riya, et al.
Published: (2025)
Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation
by: Wang, Xinyi, et al.
Published: (2026)
by: Wang, Xinyi, et al.
Published: (2026)
Debate-to-Detect: Reformulating Misinformation Detection as a Real-World Debate with Large Language Models
by: Han, Chen, et al.
Published: (2025)
by: Han, Chen, et al.
Published: (2025)
Ensemble Debates with Local Large Language Models for AI Alignment
by: Sarabamoun, Ephraiem
Published: (2025)
by: Sarabamoun, Ephraiem
Published: (2025)
Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements
by: Qian, Yushan, et al.
Published: (2023)
by: Qian, Yushan, et al.
Published: (2023)
Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost
by: Zhan, Runzhe, et al.
Published: (2025)
by: Zhan, Runzhe, et al.
Published: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
by: Liu, Minqian, et al.
Published: (2025)
by: Liu, Minqian, et al.
Published: (2025)
Evaluating Quantized Large Language Models
by: Li, Shiyao, et al.
Published: (2024)
by: Li, Shiyao, et al.
Published: (2024)
An Empirical Study on Prompt Compression for Large Language Models
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
by: Huang, Yan, et al.
Published: (2024)
by: Huang, Yan, et al.
Published: (2024)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
by: Huang, Pengcheng, et al.
Published: (2025)
by: Huang, Pengcheng, et al.
Published: (2025)
An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
by: Li, Zongjie, et al.
Published: (2024)
by: Li, Zongjie, et al.
Published: (2024)
Limits of Large Language Models in Debating Humans
by: Flamino, James, et al.
Published: (2024)
by: Flamino, James, et al.
Published: (2024)
A Hybrid Framework for Subject Analysis: Integrating Embedding-Based Regression Models with Large Language Models
by: Liu, Jinyu, et al.
Published: (2025)
by: Liu, Jinyu, et al.
Published: (2025)
An Empirical Study of Many-to-Many Summarization with Large Language Models
by: Wang, Jiaan, et al.
Published: (2025)
by: Wang, Jiaan, et al.
Published: (2025)
What is the best model? Application-driven Evaluation for Large Language Models
by: Lian, Shiguo, et al.
Published: (2024)
by: Lian, Shiguo, et al.
Published: (2024)
Bi-Chainer: Automated Large Language Models Reasoning with Bidirectional Chaining
by: Liu, Shuqi, et al.
Published: (2024)
by: Liu, Shuqi, et al.
Published: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
by: Sabour, Sahand, et al.
Published: (2024)
by: Sabour, Sahand, et al.
Published: (2024)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
by: Zhang, Xiaotian, et al.
Published: (2023)
by: Zhang, Xiaotian, et al.
Published: (2023)
Evaluating and Optimizing Educational Content with Large Language Model Judgments
by: He-Yueya, Joy, et al.
Published: (2024)
by: He-Yueya, Joy, et al.
Published: (2024)
Similar Items
-
The Role of Model Confidence on Bias Effects in Measured Uncertainties for Vision-Language Models
by: Liu, Xinyi, et al.
Published: (2025) -
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
by: He, Hangfeng, et al.
Published: (2023) -
A Law of Next-Token Prediction in Large Language Models
by: He, Hangfeng, et al.
Published: (2024) -
On the Role of Model Prior in Real-World Inductive Reasoning
by: Liu, Zhuo, et al.
Published: (2024) -
Unveiling Divergent Inductive Biases of LLMs on Temporal Data
by: Kishore, Sindhu, et al.
Published: (2024)