Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Xiaolin, Luo, Zheng, Gao, Yicheng, Chen, Qixuan, Hu, Xiyang, Zhao, Yue, Liu, Ruishan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments
par: Gao, Yicheng, et autres
Publié: (2026)
par: Gao, Yicheng, et autres
Publié: (2026)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
par: Yang, Jinming, et autres
Publié: (2026)
par: Yang, Jinming, et autres
Publié: (2026)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024)
par: Shi, Lin, et autres
Publié: (2024)
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
par: Kumar, Shachi H, et autres
Publié: (2024)
par: Kumar, Shachi H, et autres
Publié: (2024)
BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation
par: Lai, Peng, et autres
Publié: (2026)
par: Lai, Peng, et autres
Publié: (2026)
Towards More Accurate US Presidential Election via Multi-step Reasoning with Large Language Models
par: Yu, Chenxiao, et autres
Publié: (2024)
par: Yu, Chenxiao, et autres
Publié: (2024)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge
par: Fujinuma, Yoshinari
Publié: (2025)
par: Fujinuma, Yoshinari
Publié: (2025)
Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck
par: Zhang, Hongbin, et autres
Publié: (2026)
par: Zhang, Hongbin, et autres
Publié: (2026)
Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge
par: Cantini, Riccardo, et autres
Publié: (2025)
par: Cantini, Riccardo, et autres
Publié: (2025)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
par: Ye, Jiayi, et autres
Publié: (2024)
par: Ye, Jiayi, et autres
Publié: (2024)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
par: Tong, Terry, et autres
Publié: (2025)
par: Tong, Terry, et autres
Publié: (2025)
Enhancing Large Language Models for Mobility Analytics with Semantic Location Tokenization
par: Chen, Yile, et autres
Publié: (2025)
par: Chen, Yile, et autres
Publié: (2025)
Investigating Non-Transitivity in LLM-as-a-Judge
par: Xu, Yi, et autres
Publié: (2025)
par: Xu, Yi, et autres
Publié: (2025)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
par: Wang, Yidong, et autres
Publié: (2025)
par: Wang, Yidong, et autres
Publié: (2025)
Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge
par: Spiliopoulou, Evangelia, et autres
Publié: (2025)
par: Spiliopoulou, Evangelia, et autres
Publié: (2025)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
par: Yang, Langqi, et autres
Publié: (2025)
par: Yang, Langqi, et autres
Publié: (2025)
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
par: Bao, Qiming, et autres
Publié: (2026)
par: Bao, Qiming, et autres
Publié: (2026)
Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
par: Luo, Guoqing, et autres
Publié: (2025)
par: Luo, Guoqing, et autres
Publié: (2025)
Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models
par: Roy, Saumya
Publié: (2025)
par: Roy, Saumya
Publié: (2025)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
par: Du, Yixuan, et autres
Publié: (2026)
par: Du, Yixuan, et autres
Publié: (2026)
A Survey on LLM-as-a-Judge
par: Gu, Jiawei, et autres
Publié: (2024)
par: Gu, Jiawei, et autres
Publié: (2024)
StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
par: Luo, Zheng, et autres
Publié: (2026)
par: Luo, Zheng, et autres
Publié: (2026)
Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement
par: Han, Steve, et autres
Publié: (2025)
par: Han, Steve, et autres
Publié: (2025)
Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines
par: Hu, Xiyang
Publié: (2025)
par: Hu, Xiyang
Publié: (2025)
Counterfactual Trace Auditing of LLM Agent Skills
par: Zhou, Xiaolin, et autres
Publié: (2026)
par: Zhou, Xiaolin, et autres
Publié: (2026)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
par: Yuan, Tongxin, et autres
Publié: (2024)
par: Yuan, Tongxin, et autres
Publié: (2024)
Think-J: Learning to Think for Generative LLM-as-a-Judge
par: Huang, Hui, et autres
Publié: (2025)
par: Huang, Hui, et autres
Publié: (2025)
Digital Gatekeepers: Exploring Large Language Model's Role in Immigration Decisions
par: Mao, Yicheng, et autres
Publié: (2025)
par: Mao, Yicheng, et autres
Publié: (2025)
Where is the answer? Investigating Positional Bias in Language Model Knowledge Extraction
par: Saito, Kuniaki, et autres
Publié: (2024)
par: Saito, Kuniaki, et autres
Publié: (2024)
Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce
par: Chen, Liang, et autres
Publié: (2026)
par: Chen, Liang, et autres
Publié: (2026)
Detect, Investigate, Judge and Determine: A Knowledge-guided Framework for Few-shot Fake News Detection
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
par: Ginjala, Srishti, et autres
Publié: (2026)
par: Ginjala, Srishti, et autres
Publié: (2026)
Investigating Gender Bias in LLM-Generated Stories via Psychological Stereotypes
par: Masoudian, Shahed, et autres
Publié: (2025)
par: Masoudian, Shahed, et autres
Publié: (2025)
Bayesian Calibration of Win Rate Estimation with LLM Evaluators
par: Gao, Yicheng, et autres
Publié: (2024)
par: Gao, Yicheng, et autres
Publié: (2024)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
par: Chen, Guanyu, et autres
Publié: (2026)
par: Chen, Guanyu, et autres
Publié: (2026)
LFTF: Locating First and Then Fine-Tuning for Mitigating Gender Bias in Large Language Models
par: Qin, Zhanyue, et autres
Publié: (2025)
par: Qin, Zhanyue, et autres
Publié: (2025)
Full-ECE: A Metric For Token-level Calibration on Large Language Models
par: Liu, Han, et autres
Publié: (2024)
par: Liu, Han, et autres
Publié: (2024)
Documents similaires
-
MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments
par: Gao, Yicheng, et autres
Publié: (2026) -
Quantifying and Mitigating Self-Preference Bias of LLM Judges
par: Yang, Jinming, et autres
Publié: (2026) -
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024) -
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
par: Kumar, Shachi H, et autres
Publié: (2024) -
BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation
par: Lai, Peng, et autres
Publié: (2026)