Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sandan, Isik Baran, Dinh, Tu Anh, Niehues, Jan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sigmoid Head for Quality Estimation under Language Ambiguity
par: Dinh, Tu Anh, et autres
Publié: (2026)
par: Dinh, Tu Anh, et autres
Publié: (2026)
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
par: Dinh, Tu Anh, et autres
Publié: (2025)
par: Dinh, Tu Anh, et autres
Publié: (2025)
Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
par: Dinh, Tu Anh, et autres
Publié: (2024)
par: Dinh, Tu Anh, et autres
Publié: (2024)
COMET-poly: Machine Translation Metric Grounded in Other Candidates
par: Züfle, Maike, et autres
Publié: (2025)
par: Züfle, Maike, et autres
Publié: (2025)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
par: Dinh, Tu Anh, et autres
Publié: (2024)
par: Dinh, Tu Anh, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Large Language Model (LLM) Bias Index -- LLMBI
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
EMNLP: Educator-role Moral and Normative Large Language Models Profiling
par: Jiang, Yilin, et autres
Publié: (2025)
par: Jiang, Yilin, et autres
Publié: (2025)
PustakAI: Curriculum-Aligned and Interactive Textbooks Using Large Language Models
par: Sharma, Shivam, et autres
Publié: (2025)
par: Sharma, Shivam, et autres
Publié: (2025)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
TALE: A Tool-Augmented Framework for Reference-Free Evaluation of Large Language Models
par: Badshah, Sher, et autres
Publié: (2025)
par: Badshah, Sher, et autres
Publié: (2025)
InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language Models
par: Juseon-Do, et autres
Publié: (2024)
par: Juseon-Do, et autres
Publié: (2024)
RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars
par: Hua, Yuncheng, et autres
Publié: (2025)
par: Hua, Yuncheng, et autres
Publié: (2025)
Zero-Shot Spam Email Classification Using Pre-trained Large Language Models
par: Rojas-Galeano, Sergio
Publié: (2024)
par: Rojas-Galeano, Sergio
Publié: (2024)
Enhancing Sentiment Classification and Irony Detection in Large Language Models through Advanced Prompt Engineering Techniques
par: Schmitt, Marvin, et autres
Publié: (2026)
par: Schmitt, Marvin, et autres
Publié: (2026)
PatentGPT: A Large Language Model for Intellectual Property
par: Bai, Zilong, et autres
Publié: (2024)
par: Bai, Zilong, et autres
Publié: (2024)
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
par: Iida, Kurando, et autres
Publié: (2024)
par: Iida, Kurando, et autres
Publié: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation
par: Wróbel, Krzysztof, et autres
Publié: (2026)
par: Wróbel, Krzysztof, et autres
Publié: (2026)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)
par: Kytöniemi, Joona, et autres
Publié: (2025)
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles
par: Budagam, Devichand, et autres
Publié: (2024)
par: Budagam, Devichand, et autres
Publié: (2024)
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
Evaluating Class Membership Relations in Knowledge Graphs using Large Language Models
par: Allen, Bradley P., et autres
Publié: (2024)
par: Allen, Bradley P., et autres
Publié: (2024)
Inference to the Best Explanation in Large Language Models
par: Dalal, Dhairya, et autres
Publié: (2024)
par: Dalal, Dhairya, et autres
Publié: (2024)
Streamlining Redundant Layers to Compress Large Language Models
par: Chen, Xiaodong, et autres
Publié: (2024)
par: Chen, Xiaodong, et autres
Publié: (2024)
A comprehensive taxonomy of hallucinations in Large Language Models
par: Cossio, Manuel
Publié: (2025)
par: Cossio, Manuel
Publié: (2025)
Integrating Emotional and Linguistic Models for Ethical Compliance in Large Language Models
par: Chang, Edward Y.
Publié: (2024)
par: Chang, Edward Y.
Publié: (2024)
Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models
par: Roy, Saumya
Publié: (2025)
par: Roy, Saumya
Publié: (2025)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
par: Hawkins, John
Publié: (2025)
par: Hawkins, John
Publié: (2025)
Bielik 11B v3: Multilingual Large Language Model for European Languages
par: Ociepa, Krzysztof, et autres
Publié: (2025)
par: Ociepa, Krzysztof, et autres
Publié: (2025)
Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation
par: Bouchekif, Abdessalam, et autres
Publié: (2025)
par: Bouchekif, Abdessalam, et autres
Publié: (2025)
Prompt-Time Symbolic Knowledge Capture with Large Language Models
par: Çöplü, Tolga, et autres
Publié: (2024)
par: Çöplü, Tolga, et autres
Publié: (2024)
Artificial Phantasia: Emergent Mental Imagery in Large Language Models
par: McCarty, Morgan, et autres
Publié: (2025)
par: McCarty, Morgan, et autres
Publié: (2025)
Argumentative Large Language Models for Explainable and Contestable Claim Verification
par: Freedman, Gabriel, et autres
Publié: (2024)
par: Freedman, Gabriel, et autres
Publié: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
par: Nafar, Aliakbar, et autres
Publié: (2024)
par: Nafar, Aliakbar, et autres
Publié: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
par: Xiong, Guanming, et autres
Publié: (2024)
par: Xiong, Guanming, et autres
Publié: (2024)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
par: Wang, Renxi, et autres
Publié: (2023)
par: Wang, Renxi, et autres
Publié: (2023)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
par: Paech, Samuel J.
Publié: (2023)
par: Paech, Samuel J.
Publié: (2023)
Documents similaires
-
Sigmoid Head for Quality Estimation under Language Ambiguity
par: Dinh, Tu Anh, et autres
Publié: (2026) -
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
par: Dinh, Tu Anh, et autres
Publié: (2025) -
Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
par: Dinh, Tu Anh, et autres
Publié: (2024) -
COMET-poly: Machine Translation Metric Grounded in Other Candidates
par: Züfle, Maike, et autres
Publié: (2025) -
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
par: Dinh, Tu Anh, et autres
Publié: (2024)