Guardado en:
| Autores principales: | Saha, Swarnadeep, Li, Xian, Ghazvininejad, Marjan, Weston, Jason, Wang, Tianlu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2501.18099 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
por: Whitehouse, Chenxi, et al.
Publicado: (2025)
por: Whitehouse, Chenxi, et al.
Publicado: (2025)
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
por: Saha, Swarnadeep, et al.
Publicado: (2023)
por: Saha, Swarnadeep, et al.
Publicado: (2023)
Contextual Position Encoding: Learning to Count What's Important
por: Golovneva, Olga, et al.
Publicado: (2024)
por: Golovneva, Olga, et al.
Publicado: (2024)
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
Think-J: Learning to Think for Generative LLM-as-a-Judge
por: Huang, Hui, et al.
Publicado: (2025)
por: Huang, Hui, et al.
Publicado: (2025)
Self-Taught Evaluators
por: Wang, Tianlu, et al.
Publicado: (2024)
por: Wang, Tianlu, et al.
Publicado: (2024)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs
por: Chen, Justin Chih-Yao, et al.
Publicado: (2023)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2023)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
por: Aggarwal, Pranjal, et al.
Publicado: (2025)
por: Aggarwal, Pranjal, et al.
Publicado: (2025)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
System-1.x: Learning to Balance Fast and Slow Planning with Language Models
por: Saha, Swarnadeep, et al.
Publicado: (2024)
por: Saha, Swarnadeep, et al.
Publicado: (2024)
Jointly Reinforcing Diversity and Quality in Language Model Generations
por: Li, Tianjian, et al.
Publicado: (2025)
por: Li, Tianjian, et al.
Publicado: (2025)
Self-Challenging Language Model Agents
por: Zhou, Yifei, et al.
Publicado: (2025)
por: Zhou, Yifei, et al.
Publicado: (2025)
Thinking LLMs: General Instruction Following with Thought Generation
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
por: Enguehard, Joseph, et al.
Publicado: (2025)
por: Enguehard, Joseph, et al.
Publicado: (2025)
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
por: Yu, Ping, et al.
Publicado: (2025)
por: Yu, Ping, et al.
Publicado: (2025)
Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation
por: He, Yanjie
Publicado: (2026)
por: He, Yanjie
Publicado: (2026)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
por: Tao, Leitian, et al.
Publicado: (2025)
por: Tao, Leitian, et al.
Publicado: (2025)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
por: Zhu, Jason, et al.
Publicado: (2025)
por: Zhu, Jason, et al.
Publicado: (2025)
Evaluating Metrics for Safety with LLM-as-Judges
por: Clegg, Kester, et al.
Publicado: (2025)
por: Clegg, Kester, et al.
Publicado: (2025)
Bridging Offline and Online Reinforcement Learning for LLMs
por: Lanchantin, Jack, et al.
Publicado: (2025)
por: Lanchantin, Jack, et al.
Publicado: (2025)
JudgeLRM: Large Reasoning Models as a Judge
por: Chen, Nuo, et al.
Publicado: (2025)
por: Chen, Nuo, et al.
Publicado: (2025)
Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints
por: Yang, Dongjie, et al.
Publicado: (2025)
por: Yang, Dongjie, et al.
Publicado: (2025)
Iterative Reasoning Preference Optimization
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
por: Bi, Zhenyu, et al.
Publicado: (2025)
por: Bi, Zhenyu, et al.
Publicado: (2025)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
por: Sukhbaatar, Sainbayar, et al.
Publicado: (2024)
por: Sukhbaatar, Sainbayar, et al.
Publicado: (2024)
Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
por: Tan, Sijun, et al.
Publicado: (2024)
por: Tan, Sijun, et al.
Publicado: (2024)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
por: Choukrani, Omar, et al.
Publicado: (2025)
por: Choukrani, Omar, et al.
Publicado: (2025)
Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
por: Dou, Zhihao, et al.
Publicado: (2025)
por: Dou, Zhihao, et al.
Publicado: (2025)
System-Level Natural Language Feedback
por: Yuan, Weizhe, et al.
Publicado: (2023)
por: Yuan, Weizhe, et al.
Publicado: (2023)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
por: Kim, Joongwon, et al.
Publicado: (2025)
por: Kim, Joongwon, et al.
Publicado: (2025)
Thinkless: LLM Learns When to Think
por: Fang, Gongfan, et al.
Publicado: (2025)
por: Fang, Gongfan, et al.
Publicado: (2025)
Strong hallucinations from negation and how to fix them
por: Asher, Nicholas, et al.
Publicado: (2024)
por: Asher, Nicholas, et al.
Publicado: (2024)
A Survey on LLM-as-a-Judge
por: Gu, Jiawei, et al.
Publicado: (2024)
por: Gu, Jiawei, et al.
Publicado: (2024)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
por: Wang, Yidong, et al.
Publicado: (2025)
por: Wang, Yidong, et al.
Publicado: (2025)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
por: Singla, Pratham, et al.
Publicado: (2025)
por: Singla, Pratham, et al.
Publicado: (2025)
Counterargument for Critical Thinking as Judged by AI and Humans
por: Adewumi, Tosin, et al.
Publicado: (2026)
por: Adewumi, Tosin, et al.
Publicado: (2026)
Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens
por: Yong, Xixian, et al.
Publicado: (2025)
por: Yong, Xixian, et al.
Publicado: (2025)
Ejemplares similares
-
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
por: Whitehouse, Chenxi, et al.
Publicado: (2025) -
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
por: Saha, Swarnadeep, et al.
Publicado: (2023) -
Contextual Position Encoding: Learning to Count What's Important
por: Golovneva, Olga, et al.
Publicado: (2024) -
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
por: Aggarwal, Pranjal, et al.
Publicado: (2026) -
Think-J: Learning to Think for Generative LLM-as-a-Judge
por: Huang, Hui, et al.
Publicado: (2025)