Agent-as-a-Judge
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Runyang, Cai, Hongru, Zhang, Caiqi, Xu, Qiancheng, Liu, Meng, Yu, Tiezheng, Li, Yongqi, Li, Wenjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
por: Cai, Hongru, et al.
Publicado: (2026)
por: Cai, Hongru, et al.
Publicado: (2026)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2026)
por: Xu, Qiancheng, et al.
Publicado: (2026)
Parallel Test-Time Scaling for Latent Reasoning Models
por: You, Runyang, et al.
Publicado: (2025)
por: You, Runyang, et al.
Publicado: (2025)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2024)
por: Xu, Qiancheng, et al.
Publicado: (2024)
R$^2$ec: Towards Large Recommender Models with Reasoning
por: You, Runyang, et al.
Publicado: (2025)
por: You, Runyang, et al.
Publicado: (2025)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2025)
por: Xu, Qiancheng, et al.
Publicado: (2025)
Large Language Models Empowered Personalized Web Agents
por: Cai, Hongru, et al.
Publicado: (2024)
por: Cai, Hongru, et al.
Publicado: (2024)
AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation
por: Cheng, Dongjie, et al.
Publicado: (2026)
por: Cheng, Dongjie, et al.
Publicado: (2026)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
por: Xu, Kaishuai, et al.
Publicado: (2025)
por: Xu, Kaishuai, et al.
Publicado: (2025)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
por: Xu, Kaishuai, et al.
Publicado: (2024)
por: Xu, Kaishuai, et al.
Publicado: (2024)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
por: Yuan, Tongxin, et al.
Publicado: (2024)
por: Yuan, Tongxin, et al.
Publicado: (2024)
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2025)
por: Zhang, Caiqi, et al.
Publicado: (2025)
Distillation Enhanced Generative Retrieval
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
por: Gou, Boyu, et al.
Publicado: (2025)
por: Gou, Boyu, et al.
Publicado: (2025)
COMAP: Co-Evolving World Models and Agent Policies for LLM Agents
por: Liu, Youwei, et al.
Publicado: (2026)
por: Liu, Youwei, et al.
Publicado: (2026)
Personalized Large Language Model Assistant with Evolving Conditional Memory
por: Yuan, Ruifeng, et al.
Publicado: (2023)
por: Yuan, Ruifeng, et al.
Publicado: (2023)
All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
por: Zhang, Caiqi, et al.
Publicado: (2025)
por: Zhang, Caiqi, et al.
Publicado: (2025)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
por: Shi, Zhichao, et al.
Publicado: (2025)
por: Shi, Zhichao, et al.
Publicado: (2025)
Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
por: Li, Yongqi, et al.
Publicado: (2026)
por: Li, Yongqi, et al.
Publicado: (2026)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Conformity in Large Language Models
por: Zhu, Xiaochen, et al.
Publicado: (2024)
por: Zhu, Xiaochen, et al.
Publicado: (2024)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
por: Wang, Yidong, et al.
Publicado: (2025)
por: Wang, Yidong, et al.
Publicado: (2025)
A Survey on LLM-as-a-Judge
por: Gu, Jiawei, et al.
Publicado: (2024)
por: Gu, Jiawei, et al.
Publicado: (2024)
Atomic Calibration of LLMs in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2024)
por: Zhang, Caiqi, et al.
Publicado: (2024)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
por: Li, Yongqi, et al.
Publicado: (2025)
por: Li, Yongqi, et al.
Publicado: (2025)
STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
por: Ji, Hongru, et al.
Publicado: (2026)
por: Ji, Hongru, et al.
Publicado: (2026)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
por: Zhang, Bang, et al.
Publicado: (2025)
por: Zhang, Bang, et al.
Publicado: (2025)
Language is All a Graph Needs
por: Ye, Ruosong, et al.
Publicado: (2023)
por: Ye, Ruosong, et al.
Publicado: (2023)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
por: Liu, Ruikang, et al.
Publicado: (2025)
por: Liu, Ruikang, et al.
Publicado: (2025)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
por: Duo, Jiangshan, et al.
Publicado: (2026)
por: Duo, Jiangshan, et al.
Publicado: (2026)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
por: Khalifa, Muhammad, et al.
Publicado: (2026)
por: Khalifa, Muhammad, et al.
Publicado: (2026)
LoGU: Long-form Generation with Uncertainty Expressions
por: Yang, Ruihan, et al.
Publicado: (2024)
por: Yang, Ruihan, et al.
Publicado: (2024)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
por: Bi, Zhenyu, et al.
Publicado: (2025)
por: Bi, Zhenyu, et al.
Publicado: (2025)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
por: Shi, Lin, et al.
Publicado: (2024)
por: Shi, Lin, et al.
Publicado: (2024)
DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
por: You, Ziming, et al.
Publicado: (2025)
por: You, Ziming, et al.
Publicado: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
por: Tang, Wenjie, et al.
Publicado: (2025)
por: Tang, Wenjie, et al.
Publicado: (2025)
Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
por: Thakur, Aman Singh, et al.
Publicado: (2024)
por: Thakur, Aman Singh, et al.
Publicado: (2024)
Ejemplares similares
-
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
por: Cai, Hongru, et al.
Publicado: (2026) -
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2026) -
Parallel Test-Time Scaling for Latent Reasoning Models
por: You, Runyang, et al.
Publicado: (2025) -
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2024) -
R$^2$ec: Towards Large Recommender Models with Reasoning
por: You, Runyang, et al.
Publicado: (2025)