Benchmarking Cognitive Biases in Large Language Models as Evaluators
Fuente:
arXiv
Saved in:
| Main Authors: | Koo, Ryan, Lee, Minhwa, Raheja, Vipul, Park, Jong Inn, Kim, Zae Myung, Kang, Dongyeop |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
mEdIT: Multilingual Text Editing via Instruction Tuning
by: Raheja, Vipul, et al.
Published: (2024)
by: Raheja, Vipul, et al.
Published: (2024)
APIO: Automatic Prompt Induction and Optimization for Grammatical Error Correction and Text Simplification
by: Chernodub, Artem, et al.
Published: (2025)
by: Chernodub, Artem, et al.
Published: (2025)
A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings
by: Gaim, Fitsum, et al.
Published: (2025)
by: Gaim, Fitsum, et al.
Published: (2025)
Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information
by: Park, Seungcheol, et al.
Published: (2025)
by: Park, Seungcheol, et al.
Published: (2025)
Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models
by: Kim, Zae Myung, et al.
Published: (2025)
by: Kim, Zae Myung, et al.
Published: (2025)
A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection
by: Kim, Songsoo, et al.
Published: (2025)
by: Kim, Songsoo, et al.
Published: (2025)
Unifying Uniform and Binary-coding Quantization for Accurate Compression of Large Language Models
by: Park, Seungcheol, et al.
Published: (2025)
by: Park, Seungcheol, et al.
Published: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
by: Ovcharov, Volodymyr
Published: (2026)
by: Ovcharov, Volodymyr
Published: (2026)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
by: Dinh, Tu Anh, et al.
Published: (2024)
by: Dinh, Tu Anh, et al.
Published: (2024)
HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
by: Wang, Xintao, et al.
Published: (2026)
by: Wang, Xintao, et al.
Published: (2026)
EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models
by: Gupta, Abhay, et al.
Published: (2025)
by: Gupta, Abhay, et al.
Published: (2025)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
by: Garcia-Alcoser, Michael E., et al.
Published: (2025)
by: Garcia-Alcoser, Michael E., et al.
Published: (2025)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
by: Yu, Jinzheng, et al.
Published: (2025)
by: Yu, Jinzheng, et al.
Published: (2025)
How Do Large Language Models Acquire Factual Knowledge During Pretraining?
by: Chang, Hoyeon, et al.
Published: (2024)
by: Chang, Hoyeon, et al.
Published: (2024)
Uncovering Biases with Reflective Large Language Models
by: Chang, Edward Y.
Published: (2024)
by: Chang, Edward Y.
Published: (2024)
PL-Guard: Benchmarking Language Model Safety for Polish
by: Krasnodębska, Aleksandra, et al.
Published: (2025)
by: Krasnodębska, Aleksandra, et al.
Published: (2025)
Natural Language Processing for Tigrinya: Current State and Future Directions
by: Gaim, Fitsum, et al.
Published: (2025)
by: Gaim, Fitsum, et al.
Published: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
by: Pan, Leyi, et al.
Published: (2025)
by: Pan, Leyi, et al.
Published: (2025)
Do Biased Models Have Biased Thoughts?
by: Rajwal, Swati, et al.
Published: (2025)
by: Rajwal, Swati, et al.
Published: (2025)
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles
by: Budagam, Devichand, et al.
Published: (2024)
by: Budagam, Devichand, et al.
Published: (2024)
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
by: Lee, Hwiyeong, et al.
Published: (2025)
by: Lee, Hwiyeong, et al.
Published: (2025)
Machine Unlearning for Masked Diffusion Language Models
by: Lee, Georu, et al.
Published: (2026)
by: Lee, Georu, et al.
Published: (2026)
Large Language Models are Inconsistent and Biased Evaluators
by: Stureborg, Rickard, et al.
Published: (2024)
by: Stureborg, Rickard, et al.
Published: (2024)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
by: Collado-Montañez, Jaime, et al.
Published: (2025)
by: Collado-Montañez, Jaime, et al.
Published: (2025)
Precise Length Control in Large Language Models
by: Butcher, Bradley, et al.
Published: (2024)
by: Butcher, Bradley, et al.
Published: (2024)
Large Language Models for Biomedical Article Classification
by: Proboszcz, Jakub, et al.
Published: (2026)
by: Proboszcz, Jakub, et al.
Published: (2026)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
by: Muller, Sacha, et al.
Published: (2024)
by: Muller, Sacha, et al.
Published: (2024)
Accurate Retraining-free Pruning for Pretrained Encoder-based Language Models
by: Park, Seungcheol, et al.
Published: (2023)
by: Park, Seungcheol, et al.
Published: (2023)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
by: Kytöniemi, Joona, et al.
Published: (2025)
by: Kytöniemi, Joona, et al.
Published: (2025)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
by: Adapala, Sai Teja Reddy
Published: (2025)
by: Adapala, Sai Teja Reddy
Published: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
by: Peters, Sydney, et al.
Published: (2025)
by: Peters, Sydney, et al.
Published: (2025)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
by: Paech, Samuel J.
Published: (2023)
by: Paech, Samuel J.
Published: (2023)
Strategy Adaptation in Large Language Model Werewolf Agents
by: Nakamori, Fuya, et al.
Published: (2025)
by: Nakamori, Fuya, et al.
Published: (2025)
Socially Responsible Data for Large Multilingual Language Models
by: Smart, Andrew, et al.
Published: (2024)
by: Smart, Andrew, et al.
Published: (2024)
Large Language Models for Persian $ \leftrightarrow $ English Idiom Translation
by: Rezaeimanesh, Sara, et al.
Published: (2024)
by: Rezaeimanesh, Sara, et al.
Published: (2024)
Qomhra: A Bilingual Irish and English Large Language Model
by: McInerney, Joseph, et al.
Published: (2025)
by: McInerney, Joseph, et al.
Published: (2025)
Dialect Normalization using Large Language Models and Morphological Rules
by: Dimakis, Antonios, et al.
Published: (2025)
by: Dimakis, Antonios, et al.
Published: (2025)
Towards Human Understanding of Paraphrase Types in Large Language Models
by: Meier, Dominik, et al.
Published: (2024)
by: Meier, Dominik, et al.
Published: (2024)
RUQuant: Towards Refining Uniform Quantization for Large Language Models
by: Liu, Han, et al.
Published: (2026)
by: Liu, Han, et al.
Published: (2026)
Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment
by: Johnson, Warren, et al.
Published: (2026)
by: Johnson, Warren, et al.
Published: (2026)
Similar Items
-
mEdIT: Multilingual Text Editing via Instruction Tuning
by: Raheja, Vipul, et al.
Published: (2024) -
APIO: Automatic Prompt Induction and Optimization for Grammatical Error Correction and Text Simplification
by: Chernodub, Artem, et al.
Published: (2025) -
A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings
by: Gaim, Fitsum, et al.
Published: (2025) -
Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information
by: Park, Seungcheol, et al.
Published: (2025) -
Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models
by: Kim, Zae Myung, et al.
Published: (2025)