FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Bo, Feng, Lanfei, Chen, Yunkui, Zhang, Yu, Xu, Xiao, Li, Shijian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models
por: Sahili, Zahraa Al, et al.
Publicado: (2025)
por: Sahili, Zahraa Al, et al.
Publicado: (2025)
Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization
por: Zhou, Hongli, et al.
Publicado: (2026)
por: Zhou, Hongli, et al.
Publicado: (2026)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
por: Liu, Shuliang, et al.
Publicado: (2025)
por: Liu, Shuliang, et al.
Publicado: (2025)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
por: Wang, Yidong, et al.
Publicado: (2025)
por: Wang, Yidong, et al.
Publicado: (2025)
Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
por: Zhou, Xiaolin, et al.
Publicado: (2026)
por: Zhou, Xiaolin, et al.
Publicado: (2026)
Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA
por: Belmadani, Ikram, et al.
Publicado: (2026)
por: Belmadani, Ikram, et al.
Publicado: (2026)
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
por: Marioriyad, Arash, et al.
Publicado: (2025)
por: Marioriyad, Arash, et al.
Publicado: (2025)
JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems
por: Bellibatlu, Rohith Reddy, et al.
Publicado: (2026)
por: Bellibatlu, Rohith Reddy, et al.
Publicado: (2026)
CyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation
por: Zhu, Ziyi, et al.
Publicado: (2026)
por: Zhu, Ziyi, et al.
Publicado: (2026)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
por: Shi, Lin, et al.
Publicado: (2024)
por: Shi, Lin, et al.
Publicado: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
por: Tong, Terry, et al.
Publicado: (2025)
por: Tong, Terry, et al.
Publicado: (2025)
Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector
por: Yang, Haoyan, et al.
Publicado: (2025)
por: Yang, Haoyan, et al.
Publicado: (2025)
Evaluating Scoring Bias in LLM-as-a-Judge
por: Li, Qingquan, et al.
Publicado: (2025)
por: Li, Qingquan, et al.
Publicado: (2025)
The Necessity of Setting Temperature in LLM-as-a-Judge
por: Li, Lujun, et al.
Publicado: (2026)
por: Li, Lujun, et al.
Publicado: (2026)
An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4
por: Huang, Hui, et al.
Publicado: (2024)
por: Huang, Hui, et al.
Publicado: (2024)
Agent-as-a-Judge
por: You, Runyang, et al.
Publicado: (2026)
por: You, Runyang, et al.
Publicado: (2026)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
One Token to Fool LLM-as-a-Judge
por: Zhao, Yulai, et al.
Publicado: (2025)
por: Zhao, Yulai, et al.
Publicado: (2025)
Improve LLM-as-a-Judge Ability as a General Ability
por: Yu, Jiachen, et al.
Publicado: (2025)
por: Yu, Jiachen, et al.
Publicado: (2025)
A Survey on LLM-as-a-Judge
por: Gu, Jiawei, et al.
Publicado: (2024)
por: Gu, Jiawei, et al.
Publicado: (2024)
Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges
por: Li, Weiyuan, et al.
Publicado: (2025)
por: Li, Weiyuan, et al.
Publicado: (2025)
Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge
por: Chen, Luyu, et al.
Publicado: (2025)
por: Chen, Luyu, et al.
Publicado: (2025)
Are We on the Right Way to Assessing LLM-as-a-Judge?
por: Feng, Yuanning, et al.
Publicado: (2025)
por: Feng, Yuanning, et al.
Publicado: (2025)
MR. Judge: Multimodal Reasoner as a Judge
por: Pi, Renjie, et al.
Publicado: (2025)
por: Pi, Renjie, et al.
Publicado: (2025)
SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?
por: Chen, Jiamin, et al.
Publicado: (2026)
por: Chen, Jiamin, et al.
Publicado: (2026)
Judge Anything: MLLM as a Judge Across Any Modality
por: Pu, Shu, et al.
Publicado: (2025)
por: Pu, Shu, et al.
Publicado: (2025)
Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties
por: Faisal, Fahim, et al.
Publicado: (2024)
por: Faisal, Fahim, et al.
Publicado: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
por: Jiang, Hongchao, et al.
Publicado: (2025)
por: Jiang, Hongchao, et al.
Publicado: (2025)
Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge
por: Wu, Junjie, et al.
Publicado: (2026)
por: Wu, Junjie, et al.
Publicado: (2026)
AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling
por: Miao, Yongliang, et al.
Publicado: (2026)
por: Miao, Yongliang, et al.
Publicado: (2026)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
por: Tang, Yuqi, et al.
Publicado: (2025)
por: Tang, Yuqi, et al.
Publicado: (2025)
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
por: Tang, Zhenwei, et al.
Publicado: (2026)
por: Tang, Zhenwei, et al.
Publicado: (2026)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
por: Ye, Jiayi, et al.
Publicado: (2024)
por: Ye, Jiayi, et al.
Publicado: (2024)
Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
por: Chen, Junjie, et al.
Publicado: (2026)
por: Chen, Junjie, et al.
Publicado: (2026)
Quantitative LLM Judges
por: Sahoo, Aishwarya, et al.
Publicado: (2025)
por: Sahoo, Aishwarya, et al.
Publicado: (2025)
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
por: Liu, Zhuo, et al.
Publicado: (2025)
por: Liu, Zhuo, et al.
Publicado: (2025)
Ejemplares similares
-
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026) -
AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture
por: Yang, Bo, et al.
Publicado: (2026) -
AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence
por: Yang, Bo, et al.
Publicado: (2025) -
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
por: Yang, Bo, et al.
Publicado: (2025) -
FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models
por: Sahili, Zahraa Al, et al.
Publicado: (2025)