Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saha, Swarnadeep, Li, Xian, Ghazvininejad, Marjan, Weston, Jason, Wang, Tianlu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
par: Whitehouse, Chenxi, et autres
Publié: (2025)
par: Whitehouse, Chenxi, et autres
Publié: (2025)
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
par: Saha, Swarnadeep, et autres
Publié: (2023)
par: Saha, Swarnadeep, et autres
Publié: (2023)
Contextual Position Encoding: Learning to Count What's Important
par: Golovneva, Olga, et autres
Publié: (2024)
par: Golovneva, Olga, et autres
Publié: (2024)
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
par: Aggarwal, Pranjal, et autres
Publié: (2026)
par: Aggarwal, Pranjal, et autres
Publié: (2026)
Think-J: Learning to Think for Generative LLM-as-a-Judge
par: Huang, Hui, et autres
Publié: (2025)
par: Huang, Hui, et autres
Publié: (2025)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Self-Taught Evaluators
par: Wang, Tianlu, et autres
Publié: (2024)
par: Wang, Tianlu, et autres
Publié: (2024)
ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs
par: Chen, Justin Chih-Yao, et autres
Publié: (2023)
par: Chen, Justin Chih-Yao, et autres
Publié: (2023)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
par: Wu, Tianhao, et autres
Publié: (2024)
par: Wu, Tianhao, et autres
Publié: (2024)
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
par: Enguehard, Joseph, et autres
Publié: (2025)
par: Enguehard, Joseph, et autres
Publié: (2025)
Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation
par: He, Yanjie
Publié: (2026)
par: He, Yanjie
Publié: (2026)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
par: Yasunaga, Michihiro, et autres
Publié: (2025)
par: Yasunaga, Michihiro, et autres
Publié: (2025)
System-1.x: Learning to Balance Fast and Slow Planning with Language Models
par: Saha, Swarnadeep, et autres
Publié: (2024)
par: Saha, Swarnadeep, et autres
Publié: (2024)
Thinking LLMs: General Instruction Following with Thought Generation
par: Wu, Tianhao, et autres
Publié: (2024)
par: Wu, Tianhao, et autres
Publié: (2024)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
par: Aggarwal, Pranjal, et autres
Publié: (2025)
par: Aggarwal, Pranjal, et autres
Publié: (2025)
Self-Challenging Language Model Agents
par: Zhou, Yifei, et autres
Publié: (2025)
par: Zhou, Yifei, et autres
Publié: (2025)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
par: Zhu, Jason, et autres
Publié: (2025)
par: Zhu, Jason, et autres
Publié: (2025)
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
par: Yu, Ping, et autres
Publié: (2025)
par: Yu, Ping, et autres
Publié: (2025)
Evaluating Metrics for Safety with LLM-as-Judges
par: Clegg, Kester, et autres
Publié: (2025)
par: Clegg, Kester, et autres
Publié: (2025)
Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints
par: Yang, Dongjie, et autres
Publié: (2025)
par: Yang, Dongjie, et autres
Publié: (2025)
JudgeLRM: Large Reasoning Models as a Judge
par: Chen, Nuo, et autres
Publié: (2025)
par: Chen, Nuo, et autres
Publié: (2025)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
par: Bi, Zhenyu, et autres
Publié: (2025)
par: Bi, Zhenyu, et autres
Publié: (2025)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
par: Choukrani, Omar, et autres
Publié: (2025)
par: Choukrani, Omar, et autres
Publié: (2025)
Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
par: Dou, Zhihao, et autres
Publié: (2025)
par: Dou, Zhihao, et autres
Publié: (2025)
Thinkless: LLM Learns When to Think
par: Fang, Gongfan, et autres
Publié: (2025)
par: Fang, Gongfan, et autres
Publié: (2025)
Jointly Reinforcing Diversity and Quality in Language Model Generations
par: Li, Tianjian, et autres
Publié: (2025)
par: Li, Tianjian, et autres
Publié: (2025)
Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
par: Wang, Yidong, et autres
Publié: (2025)
par: Wang, Yidong, et autres
Publié: (2025)
Iterative Reasoning Preference Optimization
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
par: Singla, Pratham, et autres
Publié: (2025)
par: Singla, Pratham, et autres
Publié: (2025)
A Survey on LLM-as-a-Judge
par: Gu, Jiawei, et autres
Publié: (2024)
par: Gu, Jiawei, et autres
Publié: (2024)
Counterargument for Critical Thinking as Judged by AI and Humans
par: Adewumi, Tosin, et autres
Publié: (2026)
par: Adewumi, Tosin, et autres
Publié: (2026)
VERT: Reliable LLM Judges for Radiology Report Evaluation
par: Bologna, Federica, et autres
Publié: (2026)
par: Bologna, Federica, et autres
Publié: (2026)
LLM-RadJudge: Achieving Radiologist-Level Evaluation for X-Ray Report Generation
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
par: Shi, Zhichao, et autres
Publié: (2025)
par: Shi, Zhichao, et autres
Publié: (2025)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024)
par: Shi, Lin, et autres
Publié: (2024)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
par: Sukhbaatar, Sainbayar, et autres
Publié: (2024)
par: Sukhbaatar, Sainbayar, et autres
Publié: (2024)
System-Level Natural Language Feedback
par: Yuan, Weizhe, et autres
Publié: (2023)
par: Yuan, Weizhe, et autres
Publié: (2023)
When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation
par: Sun, Bian, et autres
Publié: (2026)
par: Sun, Bian, et autres
Publié: (2026)
Documents similaires
-
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
par: Whitehouse, Chenxi, et autres
Publié: (2025) -
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
par: Saha, Swarnadeep, et autres
Publié: (2023) -
Contextual Position Encoding: Learning to Count What's Important
par: Golovneva, Olga, et autres
Publié: (2024) -
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
par: Aggarwal, Pranjal, et autres
Publié: (2026) -
Think-J: Learning to Think for Generative LLM-as-a-Judge
par: Huang, Hui, et autres
Publié: (2025)