Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
Fuente:
arXiv
Guardado en:
| Autores principales: | Sandan, Isik Baran, Dinh, Tu Anh, Niehues, Jan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sigmoid Head for Quality Estimation under Language Ambiguity
por: Dinh, Tu Anh, et al.
Publicado: (2026)
por: Dinh, Tu Anh, et al.
Publicado: (2026)
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
por: Dinh, Tu Anh, et al.
Publicado: (2025)
por: Dinh, Tu Anh, et al.
Publicado: (2025)
Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
por: Dinh, Tu Anh, et al.
Publicado: (2024)
por: Dinh, Tu Anh, et al.
Publicado: (2024)
COMET-poly: Machine Translation Metric Grounded in Other Candidates
por: Züfle, Maike, et al.
Publicado: (2025)
por: Züfle, Maike, et al.
Publicado: (2025)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
por: Dinh, Tu Anh, et al.
Publicado: (2024)
por: Dinh, Tu Anh, et al.
Publicado: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
por: Peters, Sydney, et al.
Publicado: (2025)
por: Peters, Sydney, et al.
Publicado: (2025)
Large Language Model (LLM) Bias Index -- LLMBI
por: Oketunji, Abiodun Finbarrs, et al.
Publicado: (2023)
por: Oketunji, Abiodun Finbarrs, et al.
Publicado: (2023)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
por: Ovcharov, Volodymyr
Publicado: (2026)
por: Ovcharov, Volodymyr
Publicado: (2026)
EMNLP: Educator-role Moral and Normative Large Language Models Profiling
por: Jiang, Yilin, et al.
Publicado: (2025)
por: Jiang, Yilin, et al.
Publicado: (2025)
PustakAI: Curriculum-Aligned and Interactive Textbooks Using Large Language Models
por: Sharma, Shivam, et al.
Publicado: (2025)
por: Sharma, Shivam, et al.
Publicado: (2025)
Robustness of Large Language Models to Perturbations in Text
por: Singh, Ayush, et al.
Publicado: (2024)
por: Singh, Ayush, et al.
Publicado: (2024)
TALE: A Tool-Augmented Framework for Reference-Free Evaluation of Large Language Models
por: Badshah, Sher, et al.
Publicado: (2025)
por: Badshah, Sher, et al.
Publicado: (2025)
InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language Models
por: Juseon-Do, et al.
Publicado: (2024)
por: Juseon-Do, et al.
Publicado: (2024)
RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars
por: Hua, Yuncheng, et al.
Publicado: (2025)
por: Hua, Yuncheng, et al.
Publicado: (2025)
Zero-Shot Spam Email Classification Using Pre-trained Large Language Models
por: Rojas-Galeano, Sergio
Publicado: (2024)
por: Rojas-Galeano, Sergio
Publicado: (2024)
Enhancing Sentiment Classification and Irony Detection in Large Language Models through Advanced Prompt Engineering Techniques
por: Schmitt, Marvin, et al.
Publicado: (2026)
por: Schmitt, Marvin, et al.
Publicado: (2026)
PatentGPT: A Large Language Model for Intellectual Property
por: Bai, Zilong, et al.
Publicado: (2024)
por: Bai, Zilong, et al.
Publicado: (2024)
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
por: Iida, Kurando, et al.
Publicado: (2024)
por: Iida, Kurando, et al.
Publicado: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation
por: Wróbel, Krzysztof, et al.
Publicado: (2026)
por: Wróbel, Krzysztof, et al.
Publicado: (2026)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
por: Tan, Xiaoyu, et al.
Publicado: (2024)
por: Tan, Xiaoyu, et al.
Publicado: (2024)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
por: Kytöniemi, Joona, et al.
Publicado: (2025)
por: Kytöniemi, Joona, et al.
Publicado: (2025)
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles
por: Budagam, Devichand, et al.
Publicado: (2024)
por: Budagam, Devichand, et al.
Publicado: (2024)
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
por: Cacioli, Jon-Paul
Publicado: (2026)
por: Cacioli, Jon-Paul
Publicado: (2026)
Evaluating Class Membership Relations in Knowledge Graphs using Large Language Models
por: Allen, Bradley P., et al.
Publicado: (2024)
por: Allen, Bradley P., et al.
Publicado: (2024)
Inference to the Best Explanation in Large Language Models
por: Dalal, Dhairya, et al.
Publicado: (2024)
por: Dalal, Dhairya, et al.
Publicado: (2024)
Streamlining Redundant Layers to Compress Large Language Models
por: Chen, Xiaodong, et al.
Publicado: (2024)
por: Chen, Xiaodong, et al.
Publicado: (2024)
A comprehensive taxonomy of hallucinations in Large Language Models
por: Cossio, Manuel
Publicado: (2025)
por: Cossio, Manuel
Publicado: (2025)
Integrating Emotional and Linguistic Models for Ethical Compliance in Large Language Models
por: Chang, Edward Y.
Publicado: (2024)
por: Chang, Edward Y.
Publicado: (2024)
Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models
por: Roy, Saumya
Publicado: (2025)
por: Roy, Saumya
Publicado: (2025)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
por: Hawkins, John
Publicado: (2025)
por: Hawkins, John
Publicado: (2025)
Bielik 11B v3: Multilingual Large Language Model for European Languages
por: Ociepa, Krzysztof, et al.
Publicado: (2025)
por: Ociepa, Krzysztof, et al.
Publicado: (2025)
Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation
por: Bouchekif, Abdessalam, et al.
Publicado: (2025)
por: Bouchekif, Abdessalam, et al.
Publicado: (2025)
Prompt-Time Symbolic Knowledge Capture with Large Language Models
por: Çöplü, Tolga, et al.
Publicado: (2024)
por: Çöplü, Tolga, et al.
Publicado: (2024)
Artificial Phantasia: Emergent Mental Imagery in Large Language Models
por: McCarty, Morgan, et al.
Publicado: (2025)
por: McCarty, Morgan, et al.
Publicado: (2025)
Argumentative Large Language Models for Explainable and Contestable Claim Verification
por: Freedman, Gabriel, et al.
Publicado: (2024)
por: Freedman, Gabriel, et al.
Publicado: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
por: Nafar, Aliakbar, et al.
Publicado: (2024)
por: Nafar, Aliakbar, et al.
Publicado: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
por: Xiong, Guanming, et al.
Publicado: (2024)
por: Xiong, Guanming, et al.
Publicado: (2024)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
por: Wang, Renxi, et al.
Publicado: (2023)
por: Wang, Renxi, et al.
Publicado: (2023)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
por: Paech, Samuel J.
Publicado: (2023)
por: Paech, Samuel J.
Publicado: (2023)
Ejemplares similares
-
Sigmoid Head for Quality Estimation under Language Ambiguity
por: Dinh, Tu Anh, et al.
Publicado: (2026) -
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
por: Dinh, Tu Anh, et al.
Publicado: (2025) -
Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
por: Dinh, Tu Anh, et al.
Publicado: (2024) -
COMET-poly: Machine Translation Metric Grounded in Other Candidates
por: Züfle, Maike, et al.
Publicado: (2025) -
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
por: Dinh, Tu Anh, et al.
Publicado: (2024)