Enregistré dans:
| Auteurs principaux: | Miao, Yongliang, Liang, Yangyang, Du, Mengnan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.08097 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NeuronScope: A Multi-Agent Framework for Explaining Polysemantic Neurons in Language Models
par: Liu, Weiqi, et autres
Publié: (2026)
par: Liu, Weiqi, et autres
Publié: (2026)
Debate Helps Weak Judges Reward Stronger Models
par: Elasky, Ethan, et autres
Publié: (2026)
par: Elasky, Ethan, et autres
Publié: (2026)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
par: Duo, Jiangshan, et autres
Publié: (2026)
par: Duo, Jiangshan, et autres
Publié: (2026)
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025)
par: Garipov, Roman, et autres
Publié: (2025)
Judge Circuits
par: Feldhus, Nils, et autres
Publié: (2026)
par: Feldhus, Nils, et autres
Publié: (2026)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
Quantitative LLM Judges
par: Sahoo, Aishwarya, et autres
Publié: (2025)
par: Sahoo, Aishwarya, et autres
Publié: (2025)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
par: Zhou, Yilun, et autres
Publié: (2025)
par: Zhou, Yilun, et autres
Publié: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)
par: Bachmann, Gregor, et autres
Publié: (2025)
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
par: Li, Zhuochun, et autres
Publié: (2026)
par: Li, Zhuochun, et autres
Publié: (2026)
One Token to Fool LLM-as-a-Judge
par: Zhao, Yulai, et autres
Publié: (2025)
par: Zhao, Yulai, et autres
Publié: (2025)
JAF: Judge Agent Forest
par: Garg, Sahil, et autres
Publié: (2026)
par: Garg, Sahil, et autres
Publié: (2026)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
par: Dong, Hongyuan, et autres
Publié: (2025)
par: Dong, Hongyuan, et autres
Publié: (2025)
SAE-FiRE: Enhancing Earnings Surprise Predictions Through Sparse Autoencoder Feature Selection
par: Zhang, Huopu, et autres
Publié: (2025)
par: Zhang, Huopu, et autres
Publié: (2025)
The Judge Variable: Challenging Judge-Agnostic Legal Judgment Prediction
par: Zambrano, Guillaume
Publié: (2025)
par: Zambrano, Guillaume
Publié: (2025)
Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge
par: Zhang, Wenbo, et autres
Publié: (2026)
par: Zhang, Wenbo, et autres
Publié: (2026)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
par: Li, Tung-Ling, et autres
Publié: (2025)
par: Li, Tung-Ling, et autres
Publié: (2025)
Learning to Judge: LLMs Designing and Applying Evaluation Rubrics
par: Siro, Clemencia, et autres
Publié: (2026)
par: Siro, Clemencia, et autres
Publié: (2026)
Comparative Analysis of Demonstration Selection Algorithms for LLM In-Context Learning
par: Shu, Dong, et autres
Publié: (2024)
par: Shu, Dong, et autres
Publié: (2024)
AdaSplash: Adaptive Sparse Flash Attention
par: Gonçalves, Nuno, et autres
Publié: (2025)
par: Gonçalves, Nuno, et autres
Publié: (2025)
Approximating Human Preferences Using a Multi-Judge Learned System
par: Sprejer, Eitán, et autres
Publié: (2025)
par: Sprejer, Eitán, et autres
Publié: (2025)
Benchmarks Saturate When The Model Gets Smarter Than The Judge
par: Ballon, Marthe, et autres
Publié: (2026)
par: Ballon, Marthe, et autres
Publié: (2026)
CodeJudge: Evaluating Code Generation with Large Language Models
par: Tong, Weixi, et autres
Publié: (2024)
par: Tong, Weixi, et autres
Publié: (2024)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
par: Shen, Yiyang, et autres
Publié: (2026)
par: Shen, Yiyang, et autres
Publié: (2026)
Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
par: Sutawika, Lintang, et autres
Publié: (2026)
par: Sutawika, Lintang, et autres
Publié: (2026)
Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
par: Jung, Jaehun, et autres
Publié: (2024)
par: Jung, Jaehun, et autres
Publié: (2024)
How to Correctly Report LLM-as-a-Judge Evaluations
par: Lee, Chungpa, et autres
Publié: (2025)
par: Lee, Chungpa, et autres
Publié: (2025)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024)
par: Xu, Tengyu, et autres
Publié: (2024)
Investigating Non-Transitivity in LLM-as-a-Judge
par: Xu, Yi, et autres
Publié: (2025)
par: Xu, Yi, et autres
Publié: (2025)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
par: Hu, Jingyu, et autres
Publié: (2024)
par: Hu, Jingyu, et autres
Publié: (2024)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
par: Wei, Zhipeng, et autres
Publié: (2024)
par: Wei, Zhipeng, et autres
Publié: (2024)
Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons
par: Hu, Renjun, et autres
Publié: (2025)
par: Hu, Renjun, et autres
Publié: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
par: Lv, Kai, et autres
Publié: (2023)
par: Lv, Kai, et autres
Publié: (2023)
Build, Judge, Optimize: A Blueprint for Continuous Improvement of Multi-Agent Consumer Assistants
par: Herrera, Alejandro Breen, et autres
Publié: (2026)
par: Herrera, Alejandro Breen, et autres
Publié: (2026)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
par: Yang, Jinming, et autres
Publié: (2026)
par: Yang, Jinming, et autres
Publié: (2026)
Documents similaires
-
NeuronScope: A Multi-Agent Framework for Explaining Polysemantic Neurons in Language Models
par: Liu, Weiqi, et autres
Publié: (2026) -
Debate Helps Weak Judges Reward Stronger Models
par: Elasky, Ethan, et autres
Publié: (2026) -
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
par: Duo, Jiangshan, et autres
Publié: (2026) -
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025) -
Judge Circuits
par: Feldhus, Nils, et autres
Publié: (2026)